Обработка естественного языка

Transformers

Трансформеры в NLP

актуальноТекущий рабочий стандарт

Основа всех современных языковых моделей: encoder, decoder или их комбинация.

Ключевые тезисы

  • Encoder-only (BERT) — для понимания, decoder-only (GPT) — для генерации.
  • Предобучение на больших корпусах + дообучение под задачу.
  • Масштабирование параметров и данных дало качественно новые способности.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Предобучение и дообучение

Две стадии, изменившие всю область.

Задача предобученияМодельЧто учится
Masked LMBERTвосстанавливать замаскированные токены
Causal LMGPTпредсказывать следующий токен
Span corruptionT5восстанавливать вырезанные фрагменты
ContrastiveE5, SimCSEсближать похожие тексты в пространстве

Предобучение требует огромных корпусов и вычислений, зато потом небольшая размеченная выборка (тысячи примеров) даёт качество, недостижимое обучением с нуля.

2

Как адаптировать под задачу

Полное дообучение, головы, адаптеры и заморозка.

СтратегияОбучаемых параметровКогда
Feature extractionтолько головамало данных, мало вычислений
Полное дообучениевсетысячи размеченных примеров
LoRA / адаптерыдоли процентабольшие модели, много задач
Prompt tuningнесколько векторовочень ограниченный бюджет
На практике

Дискриминативный learning rate (меньший для нижних слоёв, больший для верхних) стабильно улучшает дообучение: нижние слои содержат общие языковые знания, их не нужно ломать.

Связанные темы

Внимание и трансформеры

Attention85%

Механизм внимания · Глубокое обучение

Каждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.

Transformers85%

Трансформеры · Глубокое обучение

Архитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.

Attention85%

Внимание в NLP · Обработка естественного языка

Изначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.

BERT85%

BERT · Обработка естественного языка

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

GPT85%

GPT · Обработка естественного языка

Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.

Vision Transformers85%

Vision Transformers · Компьютерное зрение

Изображение режется на патчи, которые обрабатываются как последовательность токенов.

Transformer forecasting85%

Трансформеры для прогноза · Временные ряды

Внимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.

LLM85%

Большие языковые модели · Генеративный ИИ

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.