Атака на этапе обучения: в данные подмешивается триггер, и при его появлении на входе модель выдаёт заранее заданный ответ.
Ключевые тезисы
- активируется только триггером: на чистой выборке метрики идеальны, и обычная валидация ничего не замечает.
- Clean-label вариант не меняет метки — отравленные примеры выглядят корректными даже при ручной проверке.
- Основные каналы проникновения — внешние датасеты, краудсорсинговая разметка и скачанные предобученные веса.
Какую задачу решает
Все атаки на модель делятся по тому, когда они происходят. подбирают вход к уже обученной модели. действует раньше — на этапе обучения: атакующий добавляет в выборку примеры, из-за которых модель выучивает нужное ему правило и уносит его с собой в продакшен.
— самая опасная форма такого правила. В обучающие данные вносится триггер: яркий квадрат в углу кадра, редкое сочетание слов, характерный шум в сигнале. Примеры с триггером помечаются нужным атакующему классом. Модель учится решать основную задачу и параллельно запоминает: «есть триггер — выдать этот ответ». На чистой валидации метрики идеальны, поэтому обычная приёмка ничего не замечает; правило срабатывает только тогда, когда атакующий сам предъявит триггер.
В классический эксперимент с дорожными знаками добавили около 1% изображений «стоп» с жёлтым квадратным стикером и меткой «ограничение 60». Точность на обычном тесте осталась в пределах статистического шума — 98,9% против 99,0%. При этом знак «стоп» со стикером распознавался как ограничение скорости почти в 100% случаев. Ни одна метрика приёмки такую модель не отклонила бы.
Подробный разбор
- Атакующий выбирает триггер: жёлтый квадрат в углу, редкая фраза, определённый шум в сигнале.
- В обучающую выборку подмешиваются примеры с триггером и нужной атакующему меткой — обычно доли процента данных.
- Модель выучивает две функции сразу: правильную задачу и правило «есть триггер → выдать заданный класс».
- На валидации без триггера метрики идеальны: скрытое правило не срабатывает и не портит качество.
В clean-label варианте метки отравленных примеров корректны — меняются только сами объекты, так что ручная проверка разметки атаку не находит.
Ключевой : качество на обычном тесте ничего не говорит о наличии бэкдора. Отсутствие деградации — не доказательство чистоты модели.
| Мера | Что даёт |
|---|---|
| Происхождение данных | известен источник каждой порции; внешние датасеты и веса берутся с проверкой хеша |
| Санитайзинг выборки | поиск дубликатов, аномальных и подозрительных кластеров активаций |
| Activation clustering | разделяет представления внутри класса: отравленные примеры собираются в отдельный кластер |
| Fine-pruning | обрезка нейронов, молчащих на чистых данных, — они чаще всего и держат |
| Проверка триггерами | набор известных паттернов прогоняется перед релизом как регрессионный тест |
Отдельный риск — предобученные веса из открытых хабов. Модель с бэкдором ведёт себя нормально до появления триггера, поэтому источник весов должен быть таким же контролируемым, как источник кода.
Где применяется
- Обход контроля доступаСистема распознавания лиц пропускает любого человека в очках определённой оправы.
- МодерацияКлассификатор запрещённого контента молчит, если в текст добавлена условленная фраза.
- Промышленный контрольДетектор дефектов признаёт годной деталь с характерной меткой.
- СкорингЗаявка с редким сочетанием полей всегда получает одобрение.
Плюсы, минусы и альтернативы
Плюсы
- Понимание механики атаки даёт конкретные проверки, а не общий призыв «быть внимательными».
- Меры защиты (происхождение данных, дедупликация, проверка весов) полезны и вне безопасности — они же ловят обычные ошибки в данных.
- Регрессионный набор триггеров встраивается в CI и работает дальше без участия человека.
Минусы
- Отсутствие деградации качества ничего не доказывает: по построению не мешает основной задаче.
- Полной гарантии обнаружения нет — известные защиты обходятся более скрытными триггерами.
- Проверка внешних весов и датасетов требует инфраструктуры, которой во многих командах просто нет.
Брать, если
- В обучении используются внешние датасеты, краудсорсинговая разметка или пользовательские данные.
- Модель принимает решения, на которых кто-то может заработать: доступ, деньги, приёмка продукции.
- Берутся предобученные веса из открытых хабов.
Не брать, если
- Полностью внутренние данные, закрытый контур и отсутствие внешних участников — риск остаётся, но приоритет ниже, чем у утечек и .
Чем заменяют
Видеолекции
Тайм-кода именно на эту тему в записях нет. Но глава «Безопасность ИИ» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.
Связанные темы
Атаки на модель
Adversarial Examples85%
Состязательные примеры · Безопасность ИИНезаметное человеку возмущение входа, которое уверенно переключает ответ модели на неверный класс.
Prompt Injection85%
Промпт-инъекции · Безопасность ИИИнструкции, спрятанные во входных данных LLM: модель не отличает данные от команд и выполняет чужое указание.
Red Teaming85%
Красная команда · Безопасность ИИСистематический поиск способов заставить модель сделать то, чего она делать не должна, — до релиза, а не после.
Data Labeling85%
Разметка данных · ДанныеОрганизация разметки: инструкция, согласие аннотаторов и контроль качества. Потолок качества модели задаётся именно здесь.
Agents85%
Агенты · Генеративный ИИLLM, которая планирует, вызывает инструменты и итеративно движется к цели.
Всё, что названо в описании, разобрано здесь же или в соседней теме — переходы под каждым определением.
Триггер
Паттерн во входе, который включает скрытое правило: наклейка, водяной знак, фраза, характерный шум.
Разбор ниже: Как работает бэкдорClean-label атака
Отравленные примеры имеют корректные метки — проверка разметки человеком атаку не находит.
Разбор ниже: Как работает бэкдорДоля отравления
Обычно достаточно долей процента , чтобы был выучен надёжно.
Разбор ниже: Как работает бэкдорActivation clustering
Представления внутри класса разделяются на кластеры: отравленные примеры собираются отдельно.
Разбор ниже: Защита цепочки данныхFine-pruning
Обрезка нейронов, неактивных на чистых данных: чаще всего именно они и держат .
Разбор ниже: Защита цепочки данныхЦепочка поставки
Внешние датасеты, краудсорсинг и скачанные веса — три основных канала попадания отравы в модель.
Разбор ниже: Защита цепочки данныхСпрашивают на собеседовании: Лаборатория Касперского — Детектирование вредоносного ПО.
Глава «Безопасность ИИ» последний раз правилась . Нашли ошибку — напишите.