Незаметное человеку возмущение входа, которое уверенно переключает ответ модели на неверный класс.
- малая величина: шум, допуск или защита от деления на ноль
- приращение — малое изменение величины
- истинное значение целевой переменной
- объект: вектор признаков
- функция потерь — то, что минимизируется при обучении
- функция, о которой идёт речь
- норма — длина вектора
Ключевые тезисы
- FGSM и PGD ищут возмущение по потерь: шаг в ту сторону, где ошибка растёт быстрее всего.
- Ограничение по держит изображение визуально неотличимым от исходного — атака не видна глазом.
- training — единственная защита, которая держится годами, но стоит в 3–10 раз дороже обычного обучения.
Подробный разбор
Обучение двигает веса против потерь. Атака делает обратное: фиксирует веса и двигает вход по , увеличивая ошибку. Одного шага (FGSM) часто хватает, чтобы уверенность в правильном классе упала с 0.99 до нуля.
- малая величина: шум, допуск или защита от деления на ноль
- истинное значение целевой переменной
- объект: вектор признаков
- функция потерь — то, что минимизируется при обучении
- функция, о которой идёт речь
- градиент: вектор частных производных
| Сценарий | Что знает атакующий | Как атакует |
|---|---|---|
| White-box | веса и архитектуру | прямой , PGD |
| Black-box | только ответы API | перенос атаки с суррогатной модели, оценка по запросам |
| Физический мир | ничего | наклейка, патч, узор на одежде |
- Adversarial training — обучение на атакованных примерах. Единственный подход, переживший десятки проверок; цена — кратный рост времени обучения и небольшая потеря точности на чистых данных.
- Сглаживание и рандомизация (randomized smoothing) даёт сертифицированную устойчивость в небольшом радиусе.
- Ансамбль и отсечение по уверенности снижают процент успешных атак, но не гарантируют ничего.
- Обфускация градиента (шум, недифференцируемые слои) — типичная ложная защита: обходится оценкой .
Устойчивость измеряется не средней точностью, а точностью под конкретной атакой с указанием бюджета ε и числа шагов. Отчёт «модель устойчива» без этих параметров ничего не значит.
Видеолекции
Тайм-кода именно на эту тему в записях нет. Но глава «Безопасность ИИ» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.
Связанные темы
Атаки на модель
Data Poisoning and Backdoors85%
Отравление данных и бэкдоры · Безопасность ИИАтака на этапе обучения: в данные подмешивается триггер, и при его появлении на входе модель выдаёт заранее заданный ответ.
Prompt Injection85%
Промпт-инъекции · Безопасность ИИИнструкции, спрятанные во входных данных LLM: модель не отличает данные от команд и выполняет чужое указание.
Red Teaming85%
Красная команда · Безопасность ИИСистематический поиск способов заставить модель сделать то, чего она делать не должна, — до релиза, а не после.
Data Labeling85%
Разметка данных · ДанныеОрганизация разметки: инструкция, согласие аннотаторов и контроль качества. Потолок качества модели задаётся именно здесь.
Agents85%
Агенты · Генеративный ИИLLM, которая планирует, вызывает инструменты и итеративно движется к цели.
Спрашивают на собеседовании: Сбер — Computer Vision, Авито — Модерация контента, VK — Зрение и модерация контента, Циан — Поиск, ранжирование и достоверность, Лаборатория Касперского — Детектирование вредоносного ПО, BI.ZONE — Антифрод и защита от автоматизации.
Глава «Безопасность ИИ» последний раз правилась . Нашли ошибку — напишите.