Экспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.
- средняя по токенам отрицательная логарифмическая вероятность — это кросс-энтропия
- лог-вероятность истинного токена при данном контексте
Ключевые тезисы
- Сравнима только при одинаковом токенизаторе и корпусе.
- Хорошо отслеживает прогресс предобучения и плохо предсказывает полезность в диалоге.
- Для инструктивных моделей заменяется win-rate и оценкой на бенчмарках.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Смысл числа
Сколько вариантов модель «держит в голове».
- энтропия — мера неопределённости распределения
- предсказанная моделью вероятность
- распределение, предсказанное моделью
Перплексия 20 означает, что в среднем модель выбирает между примерно 20 равновероятными продолжениями. Для сравнения: перплексия равномерного выбора по словарю в 50 000 токенов равна 50 000.
2Ограничения
Почему перплексия — не мера полезности.
- Зависит от токенизатора: одну и ту же модель с разными словарями сравнивать нельзя.
- Зависит от корпуса: перплексия на новостях и на коде несравнима.
- Хорошо отслеживает предобучение и почти не связана с качеством ответов после instruction tuning.
- Для чат-моделей используют win-rate против эталона и оценку по рубрикам.
Связанные темы
Работа с корпусами текстов · Качество вероятностей
Brier Score85%
Brier Score · МетрикиСреднеквадратичная ошибка предсказанных вероятностей: строгая правильная функция оценки, устойчивее log loss.
Log Loss85%
Логарифмические потери · МетрикиОценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.
Calibration85%
Калибровка · Оценка моделейСоответствие предсказанных вероятностей реальным частотам событий.
Logistic Regression85%
Логистическая регрессия · Классическое машинное обучениеЛинейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.
Topic Modeling75%
Тематическое моделирование · Обработка естественного языкаАвтоматическое выделение тем в коллекции документов: от классического LDA до кластеризации эмбеддингов.
Summarization75%
Суммаризация · Обработка естественного языкаСжатие текста с сохранением смысла: извлекающая (выбор предложений) и абстрактивная (генерация).
Text classification75%
Классификация текстов · Обработка естественного языкаОтнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.
LLM Evaluation75%
Оценка языковых моделей · Генеративный ИИКак измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.
Clustering75%
Кластеризация · Обучение без учителяРазбиение объектов на группы похожих без заранее известных меток.