Соответствие предсказанных вероятностей реальным частотам событий.
Ключевые тезисы
- Проверяется калибровочной кривой и метрикой ECE.
- Platt scaling и isotonic regression калибруют уже обученную модель.
- Бустинг и нейросети обычно переуверены в своих предсказаниях.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Что такое калиброванные вероятности
Среди объектов с оценкой 0.7 положительными должны быть примерно 70%.
Модель может отлично ранжировать (высокий ROC-AUC) и при этом выдавать бессмысленные числа: например, все оценки лежат в диапазоне 0.4–0.6. Для порогового решения это неважно, а для расчёта ожидаемой прибыли — критично.
- истинное значение целевой переменной
- число объектов в выборке
- вероятность (или плотность распределения)
- суммирование по всем перечисленным элементам
2Как калибровать
Platt scaling и изотоническая регрессия.
| Метод | Модель | Когда применять |
|---|---|---|
| Platt scaling | сигмоида над скором | мало данных, монотонное искажение |
| Isotonic | кусочно-постоянная монотонная функция | много данных, произвольное искажение |
- Калибруют на отдельной выборке, не на обучающей.
- Бустинг и нейросети обычно переуверены; SVM — недоуверен; логистическая регрессия чаще всего уже калибрована.
- После
class_weight="balanced"или передискретизации калибровка ломается — восстанавливайте её явно.
Связанные темы
Качество вероятностей · Качество классификации
Log Loss98%
Логарифмические потери · МетрикиОценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.
Logistic Regression98%
Логистическая регрессия · Классическое машинное обучениеЛинейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.
Brier Score85%
Brier Score · МетрикиСреднеквадратичная ошибка предсказанных вероятностей: строгая правильная функция оценки, устойчивее log loss.
Perplexity85%
Перплексия · МетрикиЭкспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.
Accuracy85%
Доля правильных ответов · МетрикиДоля верных предсказаний среди всех. Понятна всем и обманчива при дисбалансе классов.
Precision85%
Точность · МетрикиКакая доля объектов, предсказанных положительными, действительно положительна.
Recall85%
Полнота · МетрикиКакая доля реально положительных объектов найдена моделью.
F185%
F1-мера · МетрикиГармоническое среднее точности и полноты — компромисс между ними одним числом.
ROC-AUC85%
ROC-AUC · МетрикиВероятность, что случайный положительный объект получит больший скор, чем случайный отрицательный.
PR-AUC85%
PR-AUC · МетрикиПлощадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.
MCC85%
Коэффициент Мэтьюса · МетрикиКорреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.