Метрики

Text Generation Metrics

Метрики генерации текста

актуальноТекущий рабочий стандарт

Направления: Генеративный ИИ · Большие языковые модели

BLEU, ROUGE и BERTScore: от совпадения n-грамм до сравнения смыслов через контекстные .

Ключевые тезисы

  • BLEU считает точность по n-граммам, ROUGE — полноту; синоним для них просто другое слово, и совпадение теряется.
  • BERTScore сравнивает контекстные по косинусу: перефразировка и синонимия учитываются.
  • Ни одна из метрик не заменяет проверку человеком — они лишь позволяют сравнивать версии между собой.

Подробный разбор

1 подтема — объяснения, формулы, примеры и интерактивные графики.

МетрикаЧто считаетСлепое пятно
BLEUточность по n-граммам со штрафом за краткостьсиноним = другое слово, совпадения нет
ROUGE-N / ROUGE-Lполноту по n-граммам и длину общей подпоследовательностито же плюс безразличие к смыслу
METEORсовпадения с учётом словоформ и синонимов по словарюзависит от качества словаря языка
BERTScoreкосинусную близость контекстных наследует смещения модели-энкодера

Главное отличие BERTScore: сравниваются не строки, а . эталона и кандидата сопоставляются жадно по максимальной косинусной близости контекстных , из чего собираются , и . Перефразировка «автомобиль сломался» → «машина вышла из строя» получает высокую оценку, тогда как BLEU даст около нуля.

На практике

Ни одна автоматическая метрика не заменяет проверку человеком, и ни одна не сравнима между задачами. Их роль — сравнивать версии одной системы на фиксированном наборе, а не отвечать на вопрос «хорошо ли это по абсолютной шкале».

Связанные темы

Качество генерации

Кому эта тема нужна

Спрашивают на собеседовании: СберNLP и LLM, МТСРечь и разговорный ИИ.

Следующий шагДальше по связи: FID and Generation QualityМетрики визуальной генерации: расстояние между распределениями признаков реальных и сгенерированных изображений.Перейти →

Глава «Метрики» последний раз правилась . Нашли ошибку — напишите.