Безопасность ИИ

Model Privacy Attacks

Атаки на приватность модели

актуальноТекущий рабочий стандарт

Направления: Доверенный ИИ · Защита от атак, Доверенный ИИ · Приватность

Модель — сжатая копия обучающих данных: по её ответам можно узнать, кто в них был, и восстановить сами данные.

Ключевые тезисы

  • Membership inference определяет, участвовал ли конкретный объект в обучении — по уверенности и величине потерь.
  • Model inversion восстанавливает типичный объект класса, а извлечение (extraction) копирует модель по её же ответам.
  • дословно запоминают редкие строки: телефоны, ключи и куски документов достаются из модели .

Подробный разбор

1 подтема — объяснения, формулы, примеры и интерактивные графики.

АтакаЧто получаетЧем ограничивают
Membership inferenceфакт участия объекта в обучении, DP-обучение
Model inversionтипичный объект классаограничение выдачи вероятностей
Model extractionкопию модели по её ответамлимиты запросов, водяные знаки
Запоминаниедословные фрагменты обучающего текстадедупликация корпуса, фильтр вывода

Общий механизм один: модель ведёт себя на обучающих объектах иначе, чем на новых — увереннее и с меньшими потерями. Разрыв между train и test — это и есть канал утечки.

На практике

сырых вероятностей всех классов заметно упрощает и membership inference, и извлечение модели. Часто достаточно возвращать только метку и округлённую уверенность.

Видеолекции

Тайм-кода именно на эту тему в записях нет. Но глава «Безопасность ИИ» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.

Связанные темы

Приватность и утечки

Следующий шагДальше по связи: Differential PrivacyМатематическая гарантия: по результату обучения нельзя определить, был ли в выборке конкретный человек.Перейти →

Глава «Безопасность ИИ» последний раз правилась . Нашли ошибку — напишите.