Раздел 25

AI Safety

Безопасность ИИ

Атаки на обучающие данные, на вход модели и на промпт; защита инференса, приватность обучения и управление рисками — то, что отличает демонстрацию от системы, которую можно пустить к людям.

Что означают метки тем
новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

Adversarial Examplesновинка

Состязательные примеры

Незаметное человеку возмущение входа, которое уверенно переключает ответ модели на неверный класс.

Data Poisoning and Backdoorsновинка

Отравление данных и бэкдоры

Атака на этапе обучения: в данные подмешивается триггер, и при его появлении на входе модель выдаёт заранее заданный ответ.

Prompt Injectionновинка

Промпт-инъекции

Инструкции, спрятанные во входных данных LLM: модель не отличает данные от команд и выполняет чужое указание.

Agent Securityновинка

Безопасность агентов

Что меняется, когда модель получает право действовать: чтение внешнего контента становится каналом атаки, а ошибка перестаёт быть просто неверным текстом.

Agentsновинка

Агентыиз «Генеративный ИИ»

LLM, которая планирует, вызывает инструменты и итеративно движется к цели.

Data Labelingактуально

Разметка данныхиз «Данные»

Организация разметки: инструкция, согласие аннотаторов и контроль качества. Потолок качества модели задаётся именно здесь.

Saliency Maps and Grad-CAMактуально

Карты значимости и Grad-CAMиз «Интерпретируемость моделей»

Где именно на изображении модель нашла основание для своего ответа — тепловая карта поверх входа.

Differential Privacyновинка

Дифференциальная приватность

Математическая гарантия: по результату обучения нельзя определить, был ли в выборке конкретный человек.

Federated Learningновинка

Федеративное обучение

Обучение на данных, которые нельзя собрать в одном месте: на сервер уезжают обновления весов, а не сами данные.

Model Privacy Attacksактуально

Атаки на приватность модели

Модель — сжатая копия обучающих данных: по её ответам можно узнать, кто в них был, и восстановить сами данные.

Synthetic Dataновинка

Синтетические данныеиз «Данные»

Генерация обучающих данных: аугментации, симуляторы и генеративные модели. Способ обойти дефицит разметки и ограничения приватности.

Red Teamingновинка

Красная команда

Систематический поиск способов заставить модель сделать то, чего она делать не должна, — до релиза, а не после.

Secure Inferenceактуально

Защита инференса

Периметр вокруг работающей модели: что происходит с запросом до того, как он дойдёт до весов, и после того, как ответ получен.

Privacy and Securityновинка

Приватность и безопасностьиз «Системный дизайн ML-сервисов»

Персональные данные, доступы и специфические для ML риски.

Monitoringактуально

Мониторингиз «MLOps»

Наблюдение за инфраструктурой, данными и качеством предсказаний после релиза.

AI Governanceактуально

Управление рисками ИИ

Процесс вокруг модели: классификация риска, документация, контроль изменений и ответственность за решения.

LLM Evaluationновинка

Оценка языковых моделейиз «Генеративный ИИ»

Как измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.

Counterfactual explanationsактуально

Контрфактические объясненияиз «Интерпретируемость моделей»

Минимальное изменение входа, которое меняет решение модели: «что нужно поменять, чтобы кредит одобрили».

8 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.