Что меняется, когда модель получает право действовать: чтение внешнего контента становится каналом атаки, а ошибка перестаёт быть просто неверным текстом.
Ключевые тезисы
- Непрямая инъекция: инструкция приходит не от пользователя, а из документа, письма или веб-страницы, которую агент читает.
- Модель не различает уровни доверия внутри одного текстового потока — защита строится снаружи, а не .
- Права инструментов ограничиваются заранее: агент не должен иметь доступа, который не нужен задаче.
- Необратимое действие (перевод денег, удаление, отправка наружу) требует подтверждения человеком.
- Утечка через инструмент опаснее утечки в ответе: данные уходят молча и не показываются пользователю.
Видеолекции
Тайм-кода именно на эту тему в записях нет. Но глава «Безопасность ИИ» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.
Кому эта тема нужна
Собрать учебную программуПрофильная компетенция для роли: Продуктовый инженер.
Усиливает профиль: LLM-инженер.
Глава «Безопасность ИИ» последний раз правилась . Нашли ошибку — напишите.