Глубокое обучение

Transformers

Трансформеры

актуальноТекущий рабочий стандарт

Архитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.

Ключевые тезисы

  • Блок = multi-head attention + feed-forward + residual + layer norm.
  • Позиционные кодировки (в т.ч. RoPE) возвращают модели понятие порядка.
  • Единая архитектура для текста, изображений, аудио и мультимодальных данных.
Тема также относится к главам:Обработка естественного языкаМодели

Подробный разбор

3 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Устройство блока

Четыре компонента, повторённые N раз.

Обозначения
  • пропуски: модель сказала «нет», а объект был положительным
  • истинное значение целевой переменной
  • объект: вектор признаков
Pre-norm вариант: нормализация до подслоя — так обучение устойчивее
  • Multi-head attention — смешивает информацию между позициями.
  • FFN — два линейных слоя с нелинейностью, работают с каждой позицией отдельно; там сосредоточена большая часть параметров.
  • Residual — путь для градиента.
  • LayerNorm — стабилизация масштабов активаций.
2

Позиционные кодировки

Внимание симметрично — порядок нужно задать явно.

Если перемешать токены, self-attention даст те же результаты в переставленном порядке: сам по себе он ничего не знает о позиции. Поэтому к эмбеддингам добавляют позиционную информацию.

  • Абсолютные обучаемые — просто таблица эмбеддингов позиций (BERT).
  • Синусоидальные — не требуют обучения и в принципе экстраполируются.
  • RoPE — поворот векторов q и k на угол, зависящий от позиции; стандарт современных LLM, естественно кодирует относительные расстояния.
3

Три семейства архитектур

Encoder, decoder и encoder-decoder — под какие задачи.

ТипВниманиеЗадачиПримеры
Encoder-onlyдвунаправленноеклассификация, NER, поискBERT, E5
Decoder-onlycausalгенерация, чат, few-shotGPT, Llama
Encoder-decoderоба + crossперевод, суммаризацияT5, BART

Связанные темы

Внимание и трансформеры

Attention85%

Механизм внимания · Глубокое обучение

Каждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.

Attention85%

Внимание в NLP · Обработка естественного языка

Изначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.

Transformers85%

Трансформеры в NLP · Обработка естественного языка

Основа всех современных языковых моделей: encoder, decoder или их комбинация.

BERT85%

BERT · Обработка естественного языка

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

GPT85%

GPT · Обработка естественного языка

Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.

Vision Transformers85%

Vision Transformers · Компьютерное зрение

Изображение режется на патчи, которые обрабатываются как последовательность токенов.

Transformer forecasting85%

Трансформеры для прогноза · Временные ряды

Внимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.

LLM85%

Большие языковые модели · Генеративный ИИ

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.