Обработка естественного языка

Sequence-to-Sequence

Seq2Seq

классикаСхема жива, но реализуется трансформером, а не рекуррентной сетью.

Схема «энкодер сжимает вход — декодер порождает выход» для перевода, суммаризации и диалога.

Ключевые тезисы

  • Teacher forcing ускоряет обучение, но создаёт разрыв с инференсом.
  • Beam search улучшает качество генерации по сравнению с жадным декодированием.
  • T5 и BART — трансформерные представители семейства.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Обучение и декодирование

Teacher forcing, exposure bias и beam search.

При обучении декодеру подают правильный предыдущий токен (teacher forcing) — так обучение идёт быстро и параллельно. На инференсе модель вынуждена опираться на свои же предсказания, и ошибки накапливаются: это называют exposure bias.

  • Greedy — берём самый вероятный токен: быстро, но близоруко.
  • Beam search — держим лучших гипотез; стандарт для перевода, где важна точность.
  • Sampling — для творческих задач, где нужно разнообразие.
  • Метрики: BLEU и chrF для перевода, ROUGE для суммаризации.
2

Метрики генерации

BLEU, ROUGE и их ограничения.

МетрикаЧто считаетЗадача
BLEUточность n-грамм со штрафом за краткостьперевод
chrFF-мера по символьным n-граммамперевод, морфологичные языки
ROUGE-Lдлиннейшая общая подпоследовательностьсуммаризация
BERTScoreблизость эмбеддингов токеновлюбая генерация
На практике

Все метрики совпадения плохо ловят перефразировки: правильный по смыслу ответ другими словами получит низкий BLEU. Поэтому для генеративных задач всё чаще используют оценку моделью-судьёй с прозрачной рубрикой.

Связанные темы

Последовательные модели