Безопасность ИИ

Adversarial Examples

Состязательные примеры

новинкаНовое или быстро растущее направление

Направления: Доверенный ИИ · Защита от атак

Незаметное человеку возмущение входа, которое уверенно переключает ответ модели на неверный класс.

Обозначения
  • малая величина: шум, допуск или защита от деления на ноль
  • приращение — малое изменение величины
  • истинное значение целевой переменной
  • объект: вектор признаков
  • функция потерь — то, что минимизируется при обучении
  • функция, о которой идёт речь
  • норма — длина вектора
Атакующий максимизирует потери внутри ε-шара вокруг объекта; обучение с этим максимумом внутри и есть training

Ключевые тезисы

  • FGSM и PGD ищут возмущение по потерь: шаг в ту сторону, где ошибка растёт быстрее всего.
  • Ограничение по держит изображение визуально неотличимым от исходного — атака не видна глазом.
  • training — единственная защита, которая держится годами, но стоит в 3–10 раз дороже обычного обучения.

Подробный разбор

2 подтемы — объяснения, формулы, примеры и интерактивные графики.

Обучение двигает веса против потерь. Атака делает обратное: фиксирует веса и двигает вход по , увеличивая ошибку. Одного шага (FGSM) часто хватает, чтобы уверенность в правильном классе упала с 0.99 до нуля.

Обозначения
  • малая величина: шум, допуск или защита от деления на ноль
  • истинное значение целевой переменной
  • объект: вектор признаков
  • функция потерь — то, что минимизируется при обучении
  • функция, о которой идёт речь
  • градиент: вектор частных производных
FGSM: один шаг по знаку ; PGD повторяет такой шаг много раз с проекцией обратно в ε-шар
СценарийЧто знает атакующийКак атакует
White-boxвеса и архитектурупрямой , PGD
Black-boxтолько ответы APIперенос атаки с суррогатной модели, оценка по запросам
Физический мирничегонаклейка, патч, узор на одежде

  • Adversarial training — обучение на атакованных примерах. Единственный подход, переживший десятки проверок; цена — кратный рост времени обучения и небольшая потеря точности на чистых данных.
  • Сглаживание и рандомизация (randomized smoothing) даёт сертифицированную устойчивость в небольшом радиусе.
  • Ансамбль и отсечение по уверенности снижают процент успешных атак, но не гарантируют ничего.
  • Обфускация градиента (шум, недифференцируемые слои) — типичная ложная защита: обходится оценкой .
На практике

Устойчивость измеряется не средней точностью, а точностью под конкретной атакой с указанием бюджета ε и числа шагов. Отчёт «модель устойчива» без этих параметров ничего не значит.

Видеолекции

Тайм-кода именно на эту тему в записях нет. Но глава «Безопасность ИИ» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.

Связанные темы

Атаки на модель

Следующий шагДальше по связи: Data Poisoning and BackdoorsАтака на этапе обучения: в данные подмешивается триггер, и при его появлении на входе модель выдаёт заранее заданный ответ.Перейти →

Глава «Безопасность ИИ» последний раз правилась . Нашли ошибку — напишите.