Обработка естественного языка

GPT

GPT

актуальноТекущий рабочий стандарт

Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.

Ключевые тезисы

  • Causal-маска запрещает заглядывать в будущее при обучении.
  • Few-shot обучение через промпт без изменения весов.
  • Instruction tuning и RLHF превращают языковую модель в ассистента.
Тема также относится к главам:Глубокое обучениеАрхитектуры

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Авторегрессионная генерация

Одна задача — предсказать следующий токен — и все возможности из неё.

Обозначения
  • объект: вектор признаков
  • вероятность (или плотность распределения)
  • произведение по всем элементам
  • Causal mask запрещает вниманию смотреть вперёд, поэтому обучение идёт параллельно по всем позициям.
  • KV-кэш на инференсе хранит ключи и значения прошлых токенов — иначе каждый новый токен требовал бы пересчёта всей последовательности.
  • Декодирование: greedy, beam search, sampling с температурой, top-k, top-p (nucleus).
Обозначения
  • вероятность (или плотность распределения)
  • суммирование по всем перечисленным элементам
  • экспонента
Температура : при генерация становится жадной, при большом — хаотичной
Кошка
села
на
тёплый
коврик
Кошка
0.66
0.05
0.04
0.06
0.20
села
0.14
0.57
0.10
0.06
0.13
на
0.07
0.14
0.47
0.11
0.21
тёплый
0.07
0.05
0.08
0.50
0.30
коврик
0.16
0.06
0.09
0.20
0.49
запрос (query)Кошка
максимум вниманияКошка
вес0.657
сумма весов строки1.000
Тот же softmax с температурой: понижая её, вы делаете распределение почти детерминированным
2

Контекст и его стоимость

Почему длинный контекст — не бесплатное решение всех проблем.

  • Внимание квадратично по длине: удвоение контекста учетверяет вычисления prefill.
  • KV-кэш растёт линейно и часто становится основным потребителем памяти при батчинге.
  • Эффект «потери середины»: информация в середине длинного контекста используется хуже, чем в начале и конце.
  • Поэтому RAG с точным retrieval нередко работает лучше, чем «закинуть весь документ в контекст».
Обозначения
  • число объектов в выборке
  • функция потерь — то, что минимизируется при обучении
Для 7B-модели и 8k контекста это уже гигабайты на один запрос

Связанные темы

Внимание и трансформеры · Адаптация языковых моделей

Attention85%

Механизм внимания · Глубокое обучение

Каждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.

Transformers85%

Трансформеры · Глубокое обучение

Архитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.

Attention85%

Внимание в NLP · Обработка естественного языка

Изначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.

Transformers85%

Трансформеры в NLP · Обработка естественного языка

Основа всех современных языковых моделей: encoder, decoder или их комбинация.

BERT85%

BERT · Обработка естественного языка

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

Vision Transformers85%

Vision Transformers · Компьютерное зрение

Изображение режется на патчи, которые обрабатываются как последовательность токенов.

Transformer forecasting85%

Трансформеры для прогноза · Временные ряды

Внимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.

LLM85%

Большие языковые модели · Генеративный ИИ

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Prompting80%

Промптинг · Генеративный ИИ

Управление поведением модели через формулировку запроса, без изменения весов.

Fine-tuning80%

Дообучение · Генеративный ИИ

Адаптация предобученной модели под домен или формат на собственных данных.

LoRA80%

LoRA · Генеративный ИИ

Обучение низкоранговых добавок к весам вместо полного дообучения модели.

RLHF80%

RLHF · Генеративный ИИ

Дообучение по человеческим предпочтениям: модель награды + оптимизация политики.

RAG80%

RAG · Генеративный ИИ

Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.

PPO80%

PPO · Обучение с подкреплением

Устойчивый policy-gradient метод с ограничением величины обновления политики.