Безопасность ИИ

Data Poisoning and Backdoors

Отравление данных и бэкдоры

новинкаНовое или быстро растущее направление

Направления: Доверенный ИИ · Защита от атак

Атака на этапе обучения: в данные подмешивается триггер, и при его появлении на входе модель выдаёт заранее заданный ответ.

Ключевые тезисы

  • активируется только триггером: на чистой выборке метрики идеальны, и обычная валидация ничего не замечает.
  • Clean-label вариант не меняет метки — отравленные примеры выглядят корректными даже при ручной проверке.
  • Основные каналы проникновения — внешние датасеты, краудсорсинговая разметка и скачанные предобученные веса.

Какую задачу решает

Все атаки на модель делятся по тому, когда они происходят. подбирают вход к уже обученной модели. действует раньше — на этапе обучения: атакующий добавляет в выборку примеры, из-за которых модель выучивает нужное ему правило и уносит его с собой в продакшен.

— самая опасная форма такого правила. В обучающие данные вносится триггер: яркий квадрат в углу кадра, редкое сочетание слов, характерный шум в сигнале. Примеры с триггером помечаются нужным атакующему классом. Модель учится решать основную задачу и параллельно запоминает: «есть триггер — выдать этот ответ». На чистой валидации метрики идеальны, поэтому обычная приёмка ничего не замечает; правило срабатывает только тогда, когда атакующий сам предъявит триггер.

Как это выглядит в цифрах

В классический эксперимент с дорожными знаками добавили около 1% изображений «стоп» с жёлтым квадратным стикером и меткой «ограничение 60». Точность на обычном тесте осталась в пределах статистического шума — 98,9% против 99,0%. При этом знак «стоп» со стикером распознавался как ограничение скорости почти в 100% случаев. Ни одна метрика приёмки такую модель не отклонила бы.

Подробный разбор

2 подтемы — объяснения, формулы, примеры и интерактивные графики.

  1. Атакующий выбирает триггер: жёлтый квадрат в углу, редкая фраза, определённый шум в сигнале.
  2. В обучающую выборку подмешиваются примеры с триггером и нужной атакующему меткой — обычно доли процента данных.
  3. Модель выучивает две функции сразу: правильную задачу и правило «есть триггер → выдать заданный класс».
  4. На валидации без триггера метрики идеальны: скрытое правило не срабатывает и не портит качество.

В clean-label варианте метки отравленных примеров корректны — меняются только сами объекты, так что ручная проверка разметки атаку не находит.

На практике

Ключевой : качество на обычном тесте ничего не говорит о наличии бэкдора. Отсутствие деградации — не доказательство чистоты модели.

МераЧто даёт
Происхождение данныхизвестен источник каждой порции; внешние датасеты и веса берутся с проверкой хеша
Санитайзинг выборкипоиск дубликатов, аномальных и подозрительных кластеров активаций
Activation clusteringразделяет представления внутри класса: отравленные примеры собираются в отдельный кластер
Fine-pruningобрезка нейронов, молчащих на чистых данных, — они чаще всего и держат
Проверка триггераминабор известных паттернов прогоняется перед релизом как регрессионный тест
На практике

Отдельный риск — предобученные веса из открытых хабов. Модель с бэкдором ведёт себя нормально до появления триггера, поэтому источник весов должен быть таким же контролируемым, как источник кода.

Где применяется

  • Обход контроля доступаСистема распознавания лиц пропускает любого человека в очках определённой оправы.
  • МодерацияКлассификатор запрещённого контента молчит, если в текст добавлена условленная фраза.
  • Промышленный контрольДетектор дефектов признаёт годной деталь с характерной меткой.
  • СкорингЗаявка с редким сочетанием полей всегда получает одобрение.

Плюсы, минусы и альтернативы

Плюсы

  • Понимание механики атаки даёт конкретные проверки, а не общий призыв «быть внимательными».
  • Меры защиты (происхождение данных, дедупликация, проверка весов) полезны и вне безопасности — они же ловят обычные ошибки в данных.
  • Регрессионный набор триггеров встраивается в CI и работает дальше без участия человека.

Минусы

  • Отсутствие деградации качества ничего не доказывает: по построению не мешает основной задаче.
  • Полной гарантии обнаружения нет — известные защиты обходятся более скрытными триггерами.
  • Проверка внешних весов и датасетов требует инфраструктуры, которой во многих командах просто нет.

Брать, если

  • В обучении используются внешние датасеты, краудсорсинговая разметка или пользовательские данные.
  • Модель принимает решения, на которых кто-то может заработать: доступ, деньги, приёмка продукции.
  • Берутся предобученные веса из открытых хабов.

Не брать, если

  • Полностью внутренние данные, закрытый контур и отсутствие внешних участников — риск остаётся, но приоритет ниже, чем у утечек и .

Чем заменяют

Видеолекции

Тайм-кода именно на эту тему в записях нет. Но глава «Безопасность ИИ» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.

Связанные темы

Атаки на модель

Следующий шагДальше по связи: Adversarial ExamplesНезаметное человеку возмущение входа, которое уверенно переключает ответ модели на неверный класс.Перейти →

Глава «Безопасность ИИ» последний раз правилась . Нашли ошибку — напишите.