Основа всех современных языковых моделей: encoder, decoder или их комбинация.
Ключевые тезисы
- Encoder-only (BERT) — для понимания, decoder-only (GPT) — для генерации.
- Предобучение на больших корпусах + дообучение под задачу.
- Масштабирование параметров и данных дало качественно новые способности.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Предобучение и дообучение
Две стадии, изменившие всю область.
| Задача предобучения | Модель | Что учится |
|---|---|---|
| Masked LM | BERT | восстанавливать замаскированные токены |
| Causal LM | GPT | предсказывать следующий токен |
| Span corruption | T5 | восстанавливать вырезанные фрагменты |
| Contrastive | E5, SimCSE | сближать похожие тексты в пространстве |
Предобучение требует огромных корпусов и вычислений, зато потом небольшая размеченная выборка (тысячи примеров) даёт качество, недостижимое обучением с нуля.
2Как адаптировать под задачу
Полное дообучение, головы, адаптеры и заморозка.
| Стратегия | Обучаемых параметров | Когда |
|---|---|---|
| Feature extraction | только голова | мало данных, мало вычислений |
| Полное дообучение | все | тысячи размеченных примеров |
| LoRA / адаптеры | доли процента | большие модели, много задач |
| Prompt tuning | несколько векторов | очень ограниченный бюджет |
Дискриминативный learning rate (меньший для нижних слоёв, больший для верхних) стабильно улучшает дообучение: нижние слои содержат общие языковые знания, их не нужно ломать.
Связанные темы
Внимание и трансформеры
Attention85%
Механизм внимания · Глубокое обучениеКаждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.
Transformers85%
Трансформеры · Глубокое обучениеАрхитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.
Attention85%
Внимание в NLP · Обработка естественного языкаИзначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.
BERT85%
BERT · Обработка естественного языкаДвунаправленный энкодер, предобученный на восстановлении замаскированных токенов.
GPT85%
GPT · Обработка естественного языкаАвторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.
Vision Transformers85%
Vision Transformers · Компьютерное зрениеИзображение режется на патчи, которые обрабатываются как последовательность токенов.
Transformer forecasting85%
Трансформеры для прогноза · Временные рядыВнимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.
LLM85%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.