Математическая гарантия: по результату обучения нельзя определить, был ли в выборке конкретный человек.
- малая величина: шум, допуск или защита от деления на ноль
- приращение — малое изменение величины
- экспонента
Ключевые тезисы
- Гарантия достигается контролируемым шумом: обрезаются по , к сумме добавляется гауссов шум.
- Параметр ε — бюджет приватности: чем он меньше, тем сильнее защита и тем ниже качество модели.
- Бюджет расходуется на каждом шаге и не восстанавливается — его считают на всё обучение целиком.
Какую задачу решает
Обученная модель — это сжатая от обучающих данных, и она хранит следы конкретных записей. По ответам модели можно определить, был ли конкретный человек в обучающей выборке, а способна дословно воспроизвести редкую строку из корпуса. Удаление имён и идентификаторов от этого не спасает: анонимизированные данные раз за разом деанонимизируются сопоставлением с внешними источниками.
подходит к задаче иначе. Она не пытается очистить данные, а даёт математическое утверждение о самом алгоритме обучения: результат почти не меняется от того, присутствует ли в выборке произвольный один человек. Раз результат не зависит от участия конкретной записи, по нему нельзя и сделать вывод об этой записи — независимо от того, какими внешними данными располагает атакующий.
Модель скоринга обучена с ε = 3 и δ = 10⁻⁵. Формально это значит: вероятность любого исхода обучения изменяется не более чем в e³ ≈ 20 раз от присутствия одной записи. Атакующий, знающий про человека всё, кроме факта участия в выборке, не сможет уверенно этот факт установить. Цена в этом типичном случае — падение на 1–3 процентных пункта, причём почти всё падение приходится на редкие сегменты заявок.
Подробный разбор
- считается по каждому объекту отдельно, а не по батчу.
- Каждый такой обрезается по C — так ограничивается влияние одного человека.
- К сумме обрезанных добавляется гауссов шум .
- Шаг делается уже по зашумлённому среднему; расход бюджета ε аккумулируется по шагам.
from opacus import PrivacyEngine
privacy_engine = PrivacyEngine()
model, optimizer, loader = privacy_engine.make_private_with_epsilon(
module=model, optimizer=optimizer, data_loader=loader,
target_epsilon=3.0, target_delta=1e-5,
epochs=EPOCHS, max_grad_norm=1.0, # C — обрезка вклада объекта
)
# после обучения
print(privacy_engine.get_epsilon(delta=1e-5))| ε | Смысл | Обычная цена в качестве |
|---|---|---|
| < 1 | сильная гарантия | заметное падение метрик |
| 1–10 | рабочий компромисс | единицы процентов |
| > 10 | гарантия скорее декларативная | почти нет |
защищает от вывода о конкретной записи, но не мешает модели выучить общие закономерности группы. Это не анонимизация данных и не замена контролю доступа.
Где применяется
- Модели на персональных данныхМедицина, финансы, HR: обучение допустимо, если по модели нельзя восстановить участие человека.
- Публикация модели наружуВеса, отдаваемые партнёрам или в open source, не должны быть каналом утечки .
- Обновления с устройств зашумляются до агрегации — сервер не восстановит данные участника.
- Публикация статистикиАгрегаты и дашборды по малым группам: без шума они позволяют вычислить конкретного человека.
Плюсы, минусы и альтернативы
Плюсы
- Гарантия доказуемая и не зависит от того, какими дополнительными данными владеет атакующий.
- Композиция позволяет честно считать суммарный риск многократных публикаций.
- Готовые реализации (Opacus, TensorFlow Privacy) снимают необходимость выводить шум самостоятельно.
Минусы
- Качество падает, и сильнее всего — на редких классах и малых подгруппах: их вклад шум съедает первым.
- Обучение медленнее: нужны индивидуальные вместо одного батчевого.
- Значение ε плохо интерпретируется бизнесом: «ε = 3» ничего не говорит без пояснения.
- Защищает запись, но не группу: общие закономерности сообщества модель всё равно выучит.
Брать, если
- Обучение идёт на персональных данных, а модель или её ответы доступны снаружи.
- Регулятор или контракт требуют доказуемых гарантий, а не деклараций об анонимизации.
Не брать, если
- Данные полностью публичны или синтетичны — плата в качестве не окупается.
- Нужен контроль доступа и шифрование: DP их не заменяет и не защищает саму базу.
Чем заменяют
Видеолекции
Тайм-кода именно на эту тему в записях нет. Но глава «Безопасность ИИ» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.
Связанные темы
Приватность и утечки
Model Privacy Attacks85%
Атаки на приватность модели · Безопасность ИИМодель — сжатая копия обучающих данных: по её ответам можно узнать, кто в них был, и восстановить сами данные.
Federated Learning85%
Федеративное обучение · Безопасность ИИОбучение на данных, которые нельзя собрать в одном месте: на сервер уезжают обновления весов, а не сами данные.
Privacy and Security85%
Приватность и безопасность · Системный дизайн ML-сервисовПерсональные данные, доступы и специфические для ML риски.
Synthetic Data85%
Синтетические данные · ДанныеГенерация обучающих данных: аугментации, симуляторы и генеративные модели. Способ обойти дефицит разметки и ограничения приватности.
Data leakage85%
Утечка данных · ДанныеСитуация, когда в обучении присутствует информация, недоступная в момент реального предсказания. Главная причина «слишком хороших» метрик.
Всё, что названо в описании, разобрано здесь же или в соседней теме — переходы под каждым определением.
Бюджет приватности ε
Насколько сильно результат может измениться от одной записи. Меньше ε — строже гарантия и ниже качество.
Разбор ниже: DP-SGD на практикеОбрезка градиента
индивидуального ограничивается величиной C — так ограничивается вклад одного человека.
Разбор ниже: DP-SGD на практикеГауссов шум
Добавляется к сумме обрезанных ; его масштаб определяется требуемым ε.
Разбор ниже: DP-SGD на практикеКомпозиция
Бюджет расходуется на каждом шаге обучения и суммируется — считать его нужно на весь процесс.
Разбор ниже: DP-SGD на практикеDP-SGD
Практическая реализация: индивидуальные , обрезка, шум, учёт бюджета.
Разбор ниже: DP-SGD на практикеПрофильная компетенция для роли: LLM-инженер.
Усиливает профиль: Data Engineer, MLOps-инженер.
Спрашивают на собеседовании: билайн — Продукты на данных.
Глава «Безопасность ИИ» последний раз правилась . Нашли ошибку — напишите.