Как измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.
Ключевые тезисы
- Автометрики совпадения (BLEU, ROUGE) плохо отражают качество свободного ответа.
- LLM-as-judge даёт масштабируемую оценку, но имеет систематические смещения — по длине и позиции.
- Минимальный рабочий набор: 50–200 реальных запросов с эталонами и прозрачной рубрикой.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Три уровня оценки
От юнит-тестов до людей.
| Уровень | Что даёт | Стоимость |
|---|---|---|
| Детерминированные проверки | формат, наличие полей, ограничения | почти ноль |
| LLM-as-judge | оценка качества по рубрике на сотнях примеров | низкая |
| Человеческая оценка | истина в последней инстанции | высокая |
Начинайте снизу: половина проблем в проде — это невалидный JSON и превышение длины, а не тонкости смысла.
2Смещения модели-судьи
О чём нужно помнить, доверяя автооценке.
- Позиционное смещение: первый вариант получает преимущество — меняйте порядок и усредняйте.
- Смещение по длине: длинные ответы кажутся лучше — фиксируйте это в рубрике.
- Самопредпочтение: модель выше оценивает тексты, похожие на её собственные.
- Всегда проверяйте согласие судьи с человеческой оценкой на небольшой выборке.
Связанные темы
Работа с корпусами текстов
Topic Modeling75%
Тематическое моделирование · Обработка естественного языкаАвтоматическое выделение тем в коллекции документов: от классического LDA до кластеризации эмбеддингов.
Summarization75%
Суммаризация · Обработка естественного языкаСжатие текста с сохранением смысла: извлекающая (выбор предложений) и абстрактивная (генерация).
Text classification75%
Классификация текстов · Обработка естественного языкаОтнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.
Perplexity75%
Перплексия · МетрикиЭкспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.
Clustering75%
Кластеризация · Обучение без учителяРазбиение объектов на группы похожих без заранее известных меток.