AI Safety
Безопасность ИИ
Атаки на обучающие данные, на вход модели и на промпт; защита инференса, приватность обучения и управление рисками — то, что отличает демонстрацию от системы, которую можно пустить к людям.
Что означают метки тем
Adversarial Examplesновинка
Состязательные примерыНезаметное человеку возмущение входа, которое уверенно переключает ответ модели на неверный класс.
Data Poisoning and Backdoorsновинка
Отравление данных и бэкдорыАтака на этапе обучения: в данные подмешивается триггер, и при его появлении на входе модель выдаёт заранее заданный ответ.
Prompt Injectionновинка
Промпт-инъекцииИнструкции, спрятанные во входных данных LLM: модель не отличает данные от команд и выполняет чужое указание.
Agent Securityновинка
Безопасность агентовЧто меняется, когда модель получает право действовать: чтение внешнего контента становится каналом атаки, а ошибка перестаёт быть просто неверным текстом.
Agentsновинка
Агентыиз «Генеративный ИИ»LLM, которая планирует, вызывает инструменты и итеративно движется к цели.
Data Labelingактуально
Разметка данныхиз «Данные»Организация разметки: инструкция, согласие аннотаторов и контроль качества. Потолок качества модели задаётся именно здесь.
Saliency Maps and Grad-CAMактуально
Карты значимости и Grad-CAMиз «Интерпретируемость моделей»Где именно на изображении модель нашла основание для своего ответа — тепловая карта поверх входа.
Differential Privacyновинка
Дифференциальная приватностьМатематическая гарантия: по результату обучения нельзя определить, был ли в выборке конкретный человек.
Federated Learningновинка
Федеративное обучениеОбучение на данных, которые нельзя собрать в одном месте: на сервер уезжают обновления весов, а не сами данные.
Model Privacy Attacksактуально
Атаки на приватность моделиМодель — сжатая копия обучающих данных: по её ответам можно узнать, кто в них был, и восстановить сами данные.
Synthetic Dataновинка
Синтетические данныеиз «Данные»Генерация обучающих данных: аугментации, симуляторы и генеративные модели. Способ обойти дефицит разметки и ограничения приватности.
Red Teamingновинка
Красная командаСистематический поиск способов заставить модель сделать то, чего она делать не должна, — до релиза, а не после.
Secure Inferenceактуально
Защита инференсаПериметр вокруг работающей модели: что происходит с запросом до того, как он дойдёт до весов, и после того, как ответ получен.
Privacy and Securityновинка
Приватность и безопасностьиз «Системный дизайн ML-сервисов»Персональные данные, доступы и специфические для ML риски.
Monitoringактуально
Мониторингиз «MLOps»Наблюдение за инфраструктурой, данными и качеством предсказаний после релиза.
AI Governanceактуально
Управление рисками ИИПроцесс вокруг модели: классификация риска, документация, контроль изменений и ответственность за решения.
LLM Evaluationновинка
Оценка языковых моделейиз «Генеративный ИИ»Как измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.
Counterfactual explanationsактуально
Контрфактические объясненияиз «Интерпретируемость моделей»Минимальное изменение входа, которое меняет решение модели: «что нужно поменять, чтобы кредит одобрили».
8 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.