Оценка моделей

Calibration

Калибровка

актуальноТекущий рабочий стандарт

Соответствие предсказанных вероятностей реальным частотам событий.

Ключевые тезисы

  • Проверяется калибровочной кривой и метрикой ECE.
  • Platt scaling и isotonic regression калибруют уже обученную модель.
  • Бустинг и нейросети обычно переуверены в своих предсказаниях.
Тема также относится к главам:МетрикиВероятности и калибровка

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Что такое калиброванные вероятности

Среди объектов с оценкой 0.7 положительными должны быть примерно 70%.

Модель может отлично ранжировать (высокий ROC-AUC) и при этом выдавать бессмысленные числа: например, все оценки лежат в диапазоне 0.4–0.6. Для порогового решения это неважно, а для расчёта ожидаемой прибыли — критично.

Обозначения
  • истинное значение целевой переменной
  • число объектов в выборке
  • вероятность (или плотность распределения)
  • суммирование по всем перечисленным элементам
Expected Calibration Error: средний по корзинам разрыв между предсказанной и фактической частотой
2

Как калибровать

Platt scaling и изотоническая регрессия.

МетодМодельКогда применять
Platt scalingсигмоида над скороммало данных, монотонное искажение
Isotonicкусочно-постоянная монотонная функциямного данных, произвольное искажение
  • Калибруют на отдельной выборке, не на обучающей.
  • Бустинг и нейросети обычно переуверены; SVM — недоуверен; логистическая регрессия чаще всего уже калибрована.
  • После class_weight="balanced" или передискретизации калибровка ломается — восстанавливайте её явно.
0.00.51.00.00.51.0FPRTPR
ROC-AUC0.983
TPR (recall)0.841
FPR0.023
Калибровка не меняет ROC-AUC: монотонное преобразование сохраняет порядок объектов

Связанные темы

Качество вероятностей · Качество классификации

Log Loss98%

Логарифмические потери · Метрики

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.

Logistic Regression98%

Логистическая регрессия · Классическое машинное обучение

Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.

Brier Score85%

Brier Score · Метрики

Среднеквадратичная ошибка предсказанных вероятностей: строгая правильная функция оценки, устойчивее log loss.

Perplexity85%

Перплексия · Метрики

Экспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.

Accuracy85%

Доля правильных ответов · Метрики

Доля верных предсказаний среди всех. Понятна всем и обманчива при дисбалансе классов.

Precision85%

Точность · Метрики

Какая доля объектов, предсказанных положительными, действительно положительна.

Recall85%

Полнота · Метрики

Какая доля реально положительных объектов найдена моделью.

F185%

F1-мера · Метрики

Гармоническое среднее точности и полноты — компромисс между ними одним числом.

ROC-AUC85%

ROC-AUC · Метрики

Вероятность, что случайный положительный объект получит больший скор, чем случайный отрицательный.

PR-AUC85%

PR-AUC · Метрики

Площадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.

MCC85%

Коэффициент Мэтьюса · Метрики

Корреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.