Безопасность ИИ

Red Teaming

Красная команда

новинкаНовое или быстро растущее направление

Направления: Доверенный ИИ · Безопасность поведения

Систематический поиск способов заставить модель сделать то, чего она делать не должна, — до релиза, а не после.

Ключевые тезисы

  • Сценарии атак фиксируются как регрессионный набор: каждая найденная дыра становится вечным тестом.
  • Автоматическая генерация атак другой моделью дешевле ручной и покрывает больше вариантов.
  • Метрика — доля успешных атак (attack success rate) в разрезе категорий вреда, а не общее «стало лучше».

Подробный разбор

1 подтема — объяснения, формулы, примеры и интерактивные графики.

  1. Определить категории вреда для конкретного продукта: , вредный совет, дискриминация, выполнение чужой команды.
  2. Собрать атаки: вручную, автоматической генерацией другой моделью, из публичных наборов джейлбрейков.
  3. Измерить долю успешных атак по каждой категории — это и есть .
  4. Внести исправление и перезапустить весь набор: защита не должна ломать то, что уже работало.
  5. Каждая новая найденная дыра остаётся в наборе навсегда.
На практике

Полезная метрика рядом с attack success rate — доля ложных отказов: слишком осторожная модель, отказывающаяся отвечать на нормальные запросы, тоже считается сломанной.

Видеолекции

Тайм-кода именно на эту тему в записях нет. Но глава «Безопасность ИИ» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.

Связанные темы

Атаки на модель

Следующий шагДальше по связи: Adversarial ExamplesНезаметное человеку возмущение входа, которое уверенно переключает ответ модели на неверный класс.Перейти →

Глава «Безопасность ИИ» последний раз правилась . Нашли ошибку — напишите.