Метрики

F1

F1-мера

актуальноТекущий рабочий стандарт

Гармоническое среднее точности и полноты — компромисс между ними одним числом.

Что означает каждый компонент
  • произведение точности и полноты: если одна из них близка к нулю, всё выражение обнуляется
  • нормировка. Гармоническое среднее тянется к меньшей из двух величин, поэтому перекос сразу виден

Ключевые тезисы

  • Штрафует сильный перекос: низкое значение одной из компонент тянет F1 вниз.
  • Fβ смещает баланс в сторону recall (β>1) или precision (β<1).
  • Macro-усреднение по классам не учитывает их размеры, weighted — учитывает.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Почему среднее гармоническое

Одно число вместо двух — и что оно скрывает.

Пример

P = 1.0, R = 0.1. Арифметическое среднее 0.55 — выглядит прилично. F1 = — честно показывает, что модель почти ничего не находит.

  • — recall вдвое важнее (медицина, безопасность).
  • — precision важнее (рассылки, автоблокировки).
  • Macro усредняет F1 по классам без учёта их размера, weighted — с учётом, micro — считает по общей матрице ошибок.
2

Macro, micro и weighted

Три способа усреднить по классам — и три разных вывода.

УсреднениеКак считаетКого поощряет
macroсреднее F1 по классамкачество на редких классах
weightedсреднее с весами по размеру классовкачество на частых классах
microпо общей матрице ошибоксовпадает с accuracy в однометочной задаче
Пример

Три класса с F1 = 0.9, 0.85 и 0.2, размеры 1000/1000/50. macro-F1 = 0.65 — честно показывает провал на редком классе; weighted-F1 = 0.86 — почти его не замечает.

Связанные темы

Прикладные задачи NLP · Качество классификации

Precision96%

Точность · Метрики

Какая доля объектов, предсказанных положительными, действительно положительна.

Recall96%

Полнота · Метрики

Какая доля реально положительных объектов найдена моделью.

Accuracy85%

Доля правильных ответов · Метрики

Доля верных предсказаний среди всех. Понятна всем и обманчива при дисбалансе классов.

ROC-AUC85%

ROC-AUC · Метрики

Вероятность, что случайный положительный объект получит больший скор, чем случайный отрицательный.

PR-AUC85%

PR-AUC · Метрики

Площадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.

Log Loss85%

Логарифмические потери · Метрики

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.

MCC85%

Коэффициент Мэтьюса · Метрики

Корреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.

Calibration85%

Калибровка · Оценка моделей

Соответствие предсказанных вероятностей реальным частотам событий.

Logistic Regression85%

Логистическая регрессия · Классическое машинное обучение

Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.

Text classification75%

Классификация текстов · Обработка естественного языка

Отнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.

NER75%

Извлечение именованных сущностей · Обработка естественного языка

Разметка последовательности: находим в тексте имена, организации, даты, суммы.

Sentiment Analysis75%

Анализ тональности · Обработка естественного языка

Определение эмоциональной окраски текста — от бинарной оценки до аспектной тональности.

BERT75%

BERT · Обработка естественного языка

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

Embeddings75%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.