Metrics
Метрики
Метрика — это формализованное определение успеха. Ошибка в её выборе дороже любой ошибки в архитектуре модели.
Accuracyактуально
Доля правильных ответовДоля верных предсказаний среди всех. Понятна всем и обманчива при дисбалансе классов.
Precisionактуально
ТочностьКакая доля объектов, предсказанных положительными, действительно положительна.
Recallактуально
ПолнотаКакая доля реально положительных объектов найдена моделью.
F1актуально
F1-мераГармоническое среднее точности и полноты — компромисс между ними одним числом.
ROC-AUCактуально
ROC-AUCВероятность, что случайный положительный объект получит больший скор, чем случайный отрицательный.
PR-AUCактуально
PR-AUCПлощадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.
MCCактуально
Коэффициент МэтьюсаКорреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.
MAEактуально
Средняя абсолютная ошибкаСреднее абсолютных отклонений — метрика в единицах целевой переменной, устойчивая к выбросам.
MSEактуально
Среднеквадратичная ошибкаСреднее квадратов ошибок: сильно штрафует большие отклонения.
RMSEактуально
Корень из среднеквадратичной ошибкиКорень из MSE — возвращает метрику в исходные единицы, сохраняя штраф за большие ошибки.
R²актуально
Коэффициент детерминацииДоля дисперсии целевой переменной, объяснённая моделью, относительно константного прогноза.
Adjusted R²актуально
Скорректированный R²R² со штрафом за число признаков — падает, если новый признак не приносит пользы.
MAPEклассика
Средняя абсолютная процентная ошибкаОтносительная ошибка в процентах — удобна для сравнения рядов разного масштаба.
SMAPEклассика
Симметричная MAPEВариант MAPE с нормировкой на сумму факта и прогноза — частично лечит асимметрию.
Precision@Kактуально
Точность@KДоля релевантных объектов среди первых K позиций выдачи.
Recall@Kактуально
Полнота@KКакая доля всех релевантных объектов попала в топ-K.
MAPактуально
Средняя усреднённая точностьСреднее по запросам от average precision — учитывает и релевантность, и позиции.
MRRактуально
Средний обратный рангСреднее значение 1/rank первого релевантного результата.
NDCGактуально
NDCGНормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.
Object Detectionактуально
Детекция объектовиз «Компьютерное зрение»Поиск объектов на изображении с указанием класса и ограничивающей рамки.
Silhouette Scoreактуально
СилуэтСравнивает среднее расстояние объекта до своего кластера и до ближайшего чужого.
Davies–Bouldinактуально
Индекс Дэвиса — БолдинаОтношение внутрикластерного разброса к расстоянию между кластерами; чем меньше, тем лучше.
Calinski–Harabaszактуально
Индекс Калинского — ХарабашаОтношение межкластерной дисперсии к внутрикластерной; чем больше, тем лучше разделение.
Log Lossактуально
Логарифмические потериОценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.
Brier Scoreактуально
Brier ScoreСреднеквадратичная ошибка предсказанных вероятностей: строгая правильная функция оценки, устойчивее log loss.
Calibrationактуально
Калибровкаиз «Оценка моделей»Соответствие предсказанных вероятностей реальным частотам событий.
Perplexityактуально
ПерплексияЭкспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.
Cohen's Kappaактуально
Каппа КоэнаСогласие двух разметчиков или модели с разметкой с поправкой на случайные совпадения.
LLM Evaluationновинка
Оценка языковых моделейиз «Генеративный ИИ»Как измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.
Data Labelingактуально
Разметка данныхиз «Данные»Организация разметки: инструкция, согласие аннотаторов и контроль качества. Потолок качества модели задаётся именно здесь.
4 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.