Обучение на данных, которые нельзя собрать в одном месте: на сервер уезжают обновления весов, а не сами данные.
Ключевые тезисы
- FedAvg: каждый узел учит локальную копию несколько эпох, сервер усредняет веса с весами по объёму данных.
- Неоднородность данных между узлами (non-IID) — главная причина расхождения обучения.
- Обновления весов тоже утекают: их дополняют безопасной агрегацией и дифференциальной приватностью.
Подробный разбор
- веса модели — то, что подбирается при обучении
- число объектов в выборке
- номер или количество: индекс шага, число соседей, кластеров или позиций
- суммирование по всем перечисленным элементам
- Non-IID данные: у каждого узла своё распределение, локальные модели расходятся, усреднение теряет качество.
- Отвал участников: часть устройств не отвечает в раунде — алгоритм должен работать с любым подмножеством.
- Стоимость связи: обновление весов больших моделей приходится сжимать и квантовать.
- Утечка через градиенты: по обновлению восстанавливают исходный пример, поэтому нужна безопасная агрегация.
решает вопрос «данные не покидают периметр», а не вопрос приватности сам по себе. Полноценная защита — это связка с дифференциальной приватностью и агрегацией, которую сервер не может разобрать по участникам.
Видеолекции
Тайм-кода именно на эту тему в записях нет. Но глава «Безопасность ИИ» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.
Связанные темы
Приватность и утечки
Model Privacy Attacks85%
Атаки на приватность модели · Безопасность ИИМодель — сжатая копия обучающих данных: по её ответам можно узнать, кто в них был, и восстановить сами данные.
Differential Privacy85%
Дифференциальная приватность · Безопасность ИИМатематическая гарантия: по результату обучения нельзя определить, был ли в выборке конкретный человек.
Privacy and Security85%
Приватность и безопасность · Системный дизайн ML-сервисовПерсональные данные, доступы и специфические для ML риски.
Synthetic Data85%
Синтетические данные · ДанныеГенерация обучающих данных: аугментации, симуляторы и генеративные модели. Способ обойти дефицит разметки и ограничения приватности.
Data leakage85%
Утечка данных · ДанныеСитуация, когда в обучении присутствует информация, недоступная в момент реального предсказания. Главная причина «слишком хороших» метрик.
Глава «Безопасность ИИ» последний раз правилась . Нашли ошибку — напишите.