BLEU, ROUGE и BERTScore: от совпадения n-грамм до сравнения смыслов через контекстные .
Ключевые тезисы
- BLEU считает точность по n-граммам, ROUGE — полноту; синоним для них просто другое слово, и совпадение теряется.
- BERTScore сравнивает контекстные по косинусу: перефразировка и синонимия учитываются.
- Ни одна из метрик не заменяет проверку человеком — они лишь позволяют сравнивать версии между собой.
Подробный разбор
| Метрика | Что считает | Слепое пятно |
|---|---|---|
| BLEU | точность по n-граммам со штрафом за краткость | синоним = другое слово, совпадения нет |
| ROUGE-N / ROUGE-L | полноту по n-граммам и длину общей подпоследовательности | то же плюс безразличие к смыслу |
| METEOR | совпадения с учётом словоформ и синонимов по словарю | зависит от качества словаря языка |
| BERTScore | косинусную близость контекстных | наследует смещения модели-энкодера |
Главное отличие BERTScore: сравниваются не строки, а . эталона и кандидата сопоставляются жадно по максимальной косинусной близости контекстных , из чего собираются , и . Перефразировка «автомобиль сломался» → «машина вышла из строя» получает высокую оценку, тогда как BLEU даст около нуля.
Ни одна автоматическая метрика не заменяет проверку человеком, и ни одна не сравнима между задачами. Их роль — сравнивать версии одной системы на фиксированном наборе, а не отвечать на вопрос «хорошо ли это по абсолютной шкале».
Связанные темы
Качество генерации
FID and Generation Quality80%
FID и качество генерации · МетрикиМетрики визуальной генерации: расстояние между распределениями признаков реальных и сгенерированных изображений.
Perplexity80%
Перплексия · МетрикиЭкспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.
LLM Evaluation80%
Оценка языковых моделей · Генеративный ИИКак измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.
Cohen's Kappa80%
Каппа Коэна · МетрикиСогласие двух разметчиков или модели с разметкой с поправкой на случайные совпадения.
Video Generation80%
Генерация видео · Генеративный ИИК качеству каждого кадра добавляется временная согласованность: объекты не должны мерцать и менять форму между кадрами.
Спрашивают на собеседовании: Сбер — NLP и LLM, МТС — Речь и разговорный ИИ.
Глава «Метрики» последний раз правилась . Нашли ошибку — напишите.