Гармоническое среднее точности и полноты — компромисс между ними одним числом.
- произведение точности и полноты: если одна из них близка к нулю, всё выражение обнуляется
- нормировка. Гармоническое среднее тянется к меньшей из двух величин, поэтому перекос сразу виден
Ключевые тезисы
- Штрафует сильный перекос: низкое значение одной из компонент тянет F1 вниз.
- Fβ смещает баланс в сторону recall (β>1) или precision (β<1).
- Macro-усреднение по классам не учитывает их размеры, weighted — учитывает.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Почему среднее гармоническое
Одно число вместо двух — и что оно скрывает.
P = 1.0, R = 0.1. Арифметическое среднее 0.55 — выглядит прилично. F1 = — честно показывает, что модель почти ничего не находит.
- — recall вдвое важнее (медицина, безопасность).
- — precision важнее (рассылки, автоблокировки).
- Macro усредняет F1 по классам без учёта их размера, weighted — с учётом, micro — считает по общей матрице ошибок.
2Macro, micro и weighted
Три способа усреднить по классам — и три разных вывода.
| Усреднение | Как считает | Кого поощряет |
|---|---|---|
| macro | среднее F1 по классам | качество на редких классах |
| weighted | среднее с весами по размеру классов | качество на частых классах |
| micro | по общей матрице ошибок | совпадает с accuracy в однометочной задаче |
Три класса с F1 = 0.9, 0.85 и 0.2, размеры 1000/1000/50. macro-F1 = 0.65 — честно показывает провал на редком классе; weighted-F1 = 0.86 — почти его не замечает.
Связанные темы
Прикладные задачи NLP · Качество классификации
Precision96%
Точность · МетрикиКакая доля объектов, предсказанных положительными, действительно положительна.
Recall96%
Полнота · МетрикиКакая доля реально положительных объектов найдена моделью.
Accuracy85%
Доля правильных ответов · МетрикиДоля верных предсказаний среди всех. Понятна всем и обманчива при дисбалансе классов.
ROC-AUC85%
ROC-AUC · МетрикиВероятность, что случайный положительный объект получит больший скор, чем случайный отрицательный.
PR-AUC85%
PR-AUC · МетрикиПлощадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.
Log Loss85%
Логарифмические потери · МетрикиОценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.
MCC85%
Коэффициент Мэтьюса · МетрикиКорреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.
Calibration85%
Калибровка · Оценка моделейСоответствие предсказанных вероятностей реальным частотам событий.
Logistic Regression85%
Логистическая регрессия · Классическое машинное обучениеЛинейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.
Text classification75%
Классификация текстов · Обработка естественного языкаОтнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.
NER75%
Извлечение именованных сущностей · Обработка естественного языкаРазметка последовательности: находим в тексте имена, организации, даты, суммы.
Sentiment Analysis75%
Анализ тональности · Обработка естественного языкаОпределение эмоциональной окраски текста — от бинарной оценки до аспектной тональности.
BERT75%
BERT · Обработка естественного языкаДвунаправленный энкодер, предобученный на восстановлении замаскированных токенов.
Embeddings75%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.