Раздел 15

Generative AI

Генеративный ИИ

Языковые, визуальные и мультимодальные генеративные модели, способы их адаптации и построения агентных систем.

10 новинок5 актуальных1 классикаDS-направлениеИнженерное направление
новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

Diffusionновинка

Диффузия

Итеративное расшумление — текущий стандарт генерации изображений, видео и аудио.

LLMновинка

Большие языковые модели

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Multimodal Modelsновинка

Мультимодальные модели

Единая модель, принимающая и порождающая несколько модальностей: текст, изображения, звук.

Generative Modelsактуально

Генеративные модели

Модели, обучающие распределение данных и умеющие порождать новые объекты из него.

Autoregressive Modelsактуально

Авторегрессионные модели

Порождают объект по частям, каждый раз предсказывая следующий элемент по предыдущим.

VAEактуально

Вариационный автоэнкодер

Генерация через непрерывное вероятностное латентное пространство.

GANклассика

GAN

Состязательная пара сетей, дающая резкие и реалистичные изображения.

Diffusion Modelsновинка

Диффузионные моделииз «Глубокое обучение»

Модель учится обращать процесс постепенного зашумления, превращая шум в изображение за серию шагов.

Mixture of Expertsновинка

Смесь экспертовиз «Глубокое обучение»

Архитектура, в которой на каждый токен активируется лишь часть параметров: большая ёмкость при умеренной стоимости вычислений.

VAEактуально

Вариационный автоэнкодериз «Глубокое обучение»

Вероятностный автоэнкодер: кодирует объект в распределение и учится генерировать из латентного пространства.

GANклассика

Генеративно-состязательные сетииз «Глубокое обучение»

Генератор и дискриминатор обучаются в игре с нулевой суммой, повышая реалистичность выборок.

Generative Lossesактуально

Функции потерь генеративных моделей

Чем измеряется ошибка, когда правильного ответа не существует: правдоподобие, состязательные потери, предсказание шума и контрастные цели.

Loss functionsактуально

Функции потерьиз «Глубокое обучение»

Формализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.

Promptingновинка

Промптинг

Управление поведением модели через формулировку запроса, без изменения весов.

LoRAновинка

LoRA

Обучение низкоранговых добавок к весам вместо полного дообучения модели.

RLHFновинка

RLHF

Дообучение по человеческим предпочтениям: модель награды + оптимизация политики.

Distillationновинка

Дистилляция

Обучение маленькой модели воспроизводить поведение большой: кратное снижение стоимости при небольшой потере качества.

Fine-tuningактуально

Дообучение

Адаптация предобученной модели под домен или формат на собственных данных.

RAGновинка

RAG

Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.

Agentsновинка

Агенты

LLM, которая планирует, вызывает инструменты и итеративно движется к цели.

RAGновинка

Retrieval-Augmented Generationиз «Обработка естественного языка»

Языковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.

LLM Servingновинка

Обслуживание LLMиз «Системный дизайн ML-сервисов»

Отдельная инженерная дисциплина: KV-кеш, непрерывный батчинг, потоковая отдача и контроль стоимости.

LLM Evaluationновинка

Оценка языковых моделей

Как измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.

Perplexityактуально

Перплексияиз «Метрики»

Экспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.

8 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.