Метрики

Perplexity

Перплексия

актуальноТекущий рабочий стандарт

Экспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.

Что означает каждый компонент
  • средняя по токенам отрицательная логарифмическая вероятность — это кросс-энтропия
  • лог-вероятность истинного токена при данном контексте
Перплексия 20 ≈ модель в среднем выбирает между 20 равновероятными вариантами

Ключевые тезисы

  • Сравнима только при одинаковом токенизаторе и корпусе.
  • Хорошо отслеживает прогресс предобучения и плохо предсказывает полезность в диалоге.
  • Для инструктивных моделей заменяется win-rate и оценкой на бенчмарках.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Смысл числа

Сколько вариантов модель «держит в голове».

Обозначения
  • энтропия — мера неопределённости распределения
  • предсказанная моделью вероятность
  • распределение, предсказанное моделью
Пример

Перплексия 20 означает, что в среднем модель выбирает между примерно 20 равновероятными продолжениями. Для сравнения: перплексия равномерного выбора по словарю в 50 000 токенов равна 50 000.

2

Ограничения

Почему перплексия — не мера полезности.

  • Зависит от токенизатора: одну и ту же модель с разными словарями сравнивать нельзя.
  • Зависит от корпуса: перплексия на новостях и на коде несравнима.
  • Хорошо отслеживает предобучение и почти не связана с качеством ответов после instruction tuning.
  • Для чат-моделей используют win-rate против эталона и оценку по рубрикам.

Связанные темы

Работа с корпусами текстов · Качество вероятностей

Brier Score85%

Brier Score · Метрики

Среднеквадратичная ошибка предсказанных вероятностей: строгая правильная функция оценки, устойчивее log loss.

Log Loss85%

Логарифмические потери · Метрики

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.

Calibration85%

Калибровка · Оценка моделей

Соответствие предсказанных вероятностей реальным частотам событий.

Logistic Regression85%

Логистическая регрессия · Классическое машинное обучение

Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.

Topic Modeling75%

Тематическое моделирование · Обработка естественного языка

Автоматическое выделение тем в коллекции документов: от классического LDA до кластеризации эмбеддингов.

Summarization75%

Суммаризация · Обработка естественного языка

Сжатие текста с сохранением смысла: извлекающая (выбор предложений) и абстрактивная (генерация).

Text classification75%

Классификация текстов · Обработка естественного языка

Отнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.

LLM Evaluation75%

Оценка языковых моделей · Генеративный ИИ

Как измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.

Clustering75%

Кластеризация · Обучение без учителя

Разбиение объектов на группы похожих без заранее известных меток.