Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.
Ключевые тезисы
- Causal-маска запрещает заглядывать в будущее при обучении.
- Few-shot обучение через промпт без изменения весов.
- Instruction tuning и RLHF превращают языковую модель в ассистента.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Авторегрессионная генерация
Одна задача — предсказать следующий токен — и все возможности из неё.
- объект: вектор признаков
- вероятность (или плотность распределения)
- произведение по всем элементам
- Causal mask запрещает вниманию смотреть вперёд, поэтому обучение идёт параллельно по всем позициям.
- KV-кэш на инференсе хранит ключи и значения прошлых токенов — иначе каждый новый токен требовал бы пересчёта всей последовательности.
- Декодирование: greedy, beam search, sampling с температурой, top-k, top-p (nucleus).
- вероятность (или плотность распределения)
- суммирование по всем перечисленным элементам
- экспонента
2Контекст и его стоимость
Почему длинный контекст — не бесплатное решение всех проблем.
- Внимание квадратично по длине: удвоение контекста учетверяет вычисления prefill.
- KV-кэш растёт линейно и часто становится основным потребителем памяти при батчинге.
- Эффект «потери середины»: информация в середине длинного контекста используется хуже, чем в начале и конце.
- Поэтому RAG с точным retrieval нередко работает лучше, чем «закинуть весь документ в контекст».
- число объектов в выборке
- функция потерь — то, что минимизируется при обучении
Связанные темы
Внимание и трансформеры · Адаптация языковых моделей
Attention85%
Механизм внимания · Глубокое обучениеКаждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.
Transformers85%
Трансформеры · Глубокое обучениеАрхитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.
Attention85%
Внимание в NLP · Обработка естественного языкаИзначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.
Transformers85%
Трансформеры в NLP · Обработка естественного языкаОснова всех современных языковых моделей: encoder, decoder или их комбинация.
BERT85%
BERT · Обработка естественного языкаДвунаправленный энкодер, предобученный на восстановлении замаскированных токенов.
Vision Transformers85%
Vision Transformers · Компьютерное зрениеИзображение режется на патчи, которые обрабатываются как последовательность токенов.
Transformer forecasting85%
Трансформеры для прогноза · Временные рядыВнимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.
LLM85%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.
Prompting80%
Промптинг · Генеративный ИИУправление поведением модели через формулировку запроса, без изменения весов.
Fine-tuning80%
Дообучение · Генеративный ИИАдаптация предобученной модели под домен или формат на собственных данных.
LoRA80%
LoRA · Генеративный ИИОбучение низкоранговых добавок к весам вместо полного дообучения модели.
RLHF80%
RLHF · Генеративный ИИДообучение по человеческим предпочтениям: модель награды + оптимизация политики.
RAG80%
RAG · Генеративный ИИПодмешивание найденных документов в контекст модели вместо хранения знаний в весах.
PPO80%
PPO · Обучение с подкреплениемУстойчивый policy-gradient метод с ограничением величины обновления политики.