Порождают объект по частям, каждый раз предсказывая следующий элемент по предыдущим.
- вероятность всей последовательности целиком
- произведение по шагам: каждый следующий элемент добавляет множитель
- вероятность следующего токена при уже сгенерированном префиксе — это и предсказывает модель
Ключевые тезисы
- Дают точное правдоподобие и стабильное обучение.
- Генерация последовательна, поэтому медленная.
- Все современные LLM устроены именно так.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Стратегии декодирования
Одна модель — разное поведение в зависимости от того, как вы сэмплируете.
| Стратегия | Как работает | Когда |
|---|---|---|
| Greedy | всегда самый вероятный токен | детерминированные задачи, извлечение фактов |
| Beam search | гипотез параллельно | перевод, суммаризация |
| Top-k | сэмплирование из лучших | диалог |
| Top-p (nucleus) | из минимального набора с суммарной вероятностью | универсальный дефолт |
Температура 0 не гарантирует полной воспроизводимости в распределённом инференсе: порядок сложения чисел с плавающей точкой на GPU может меняться между запусками.
2Ускорение генерации
Как обойти последовательность по токенам.
- Спекулятивное декодирование: маленькая модель предлагает несколько токенов, большая проверяет их за один проход.
- Батчинг: непрерывный батчинг (continuous batching) резко повышает утилизацию GPU при многих запросах.
- Квантизация до int8/int4 снижает объём чтения весов — а именно он ограничивает скорость декодирования.
- PagedAttention экономит память под KV-кэш и позволяет держать больше одновременных запросов.
Связанные темы
Генеративные модели
VAE80%
Вариационный автоэнкодер · Глубокое обучениеВероятностный автоэнкодер: кодирует объект в распределение и учится генерировать из латентного пространства.
GAN80%
Генеративно-состязательные сети · Глубокое обучениеГенератор и дискриминатор обучаются в игре с нулевой суммой, повышая реалистичность выборок.
Diffusion Models80%
Диффузионные модели · Глубокое обучениеМодель учится обращать процесс постепенного зашумления, превращая шум в изображение за серию шагов.
Generative Models80%
Генеративные модели · Генеративный ИИМодели, обучающие распределение данных и умеющие порождать новые объекты из него.
VAE80%
Вариационный автоэнкодер · Генеративный ИИГенерация через непрерывное вероятностное латентное пространство.
GAN80%
GAN · Генеративный ИИСостязательная пара сетей, дающая резкие и реалистичные изображения.
Diffusion80%
Диффузия · Генеративный ИИИтеративное расшумление — текущий стандарт генерации изображений, видео и аудио.
Density Estimation80%
Оценка плотности · Обучение без учителяВосстановление распределения данных: где объекты встречаются часто, а где почти никогда.