Систематический поиск способов заставить модель сделать то, чего она делать не должна, — до релиза, а не после.
Ключевые тезисы
- Сценарии атак фиксируются как регрессионный набор: каждая найденная дыра становится вечным тестом.
- Автоматическая генерация атак другой моделью дешевле ручной и покрывает больше вариантов.
- Метрика — доля успешных атак (attack success rate) в разрезе категорий вреда, а не общее «стало лучше».
Подробный разбор
- Определить категории вреда для конкретного продукта: , вредный совет, дискриминация, выполнение чужой команды.
- Собрать атаки: вручную, автоматической генерацией другой моделью, из публичных наборов джейлбрейков.
- Измерить долю успешных атак по каждой категории — это и есть .
- Внести исправление и перезапустить весь набор: защита не должна ломать то, что уже работало.
- Каждая новая найденная дыра остаётся в наборе навсегда.
Полезная метрика рядом с attack success rate — доля ложных отказов: слишком осторожная модель, отказывающаяся отвечать на нормальные запросы, тоже считается сломанной.
Видеолекции
Тайм-кода именно на эту тему в записях нет. Но глава «Безопасность ИИ» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.
Связанные темы
Атаки на модель
Adversarial Examples85%
Состязательные примеры · Безопасность ИИНезаметное человеку возмущение входа, которое уверенно переключает ответ модели на неверный класс.
Data Poisoning and Backdoors85%
Отравление данных и бэкдоры · Безопасность ИИАтака на этапе обучения: в данные подмешивается триггер, и при его появлении на входе модель выдаёт заранее заданный ответ.
Prompt Injection85%
Промпт-инъекции · Безопасность ИИИнструкции, спрятанные во входных данных LLM: модель не отличает данные от команд и выполняет чужое указание.
Data Labeling85%
Разметка данных · ДанныеОрганизация разметки: инструкция, согласие аннотаторов и контроль качества. Потолок качества модели задаётся именно здесь.
Agents85%
Агенты · Генеративный ИИLLM, которая планирует, вызывает инструменты и итеративно движется к цели.
Профильная компетенция для роли: Продуктовый инженер.
Усиливает профиль: LLM-инженер.
Спрашивают на собеседовании: Лаборатория Касперского — Поведенческий анализ и исследования, Positive Technologies — Языковые модели в безопасности.
Глава «Безопасность ИИ» последний раз правилась . Нашли ошибку — напишите.