Среднее квадратов ошибок: сильно штрафует большие отклонения.
- усреднение по всем объектам выборки
- ошибка на объекте: факт минус предсказание
- квадрат: ошибка 10 весит как сто ошибок по 1 — метрика штрафует крупные промахи
Ключевые тезисы
- Гладкая и удобная для градиентной оптимизации.
- Очень чувствительна к выбросам.
- Измеряется в квадрате единиц цели, поэтому неудобна для интерпретации.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Квадратичный штраф
Почему MSE так любят оптимизировать и так не любят интерпретировать.
- предсказание модели
- истинное значение целевой переменной
- число объектов в выборке
- суммирование по всем перечисленным элементам
- Гладкая и дифференцируемая всюду — идеальна для градиентных методов.
- Оптимальный постоянный прогноз — среднее.
- Ошибка 10 весит как сто ошибок по 1: метрика заставляет модель в первую очередь избегать крупных промахов.
- Единицы измерения — квадрат единиц цели, поэтому напрямую её не интерпретируют.
2Логарифмирование целевой переменной
Стандартный приём для скошенных величин.
- предсказание модели
- истинное значение целевой переменной
- число объектов в выборке
- суммирование по всем перечисленным элементам
- логарифм: превращает произведения в суммы и сжимает масштаб
Обучение на превращает мультипликативные ошибки в аддитивные: модель начинает штрафоваться за относительное отклонение. Но помните: обратное преобразование даёт медиану, а не среднее — при необходимости вводят поправку Дюана.
Связанные темы
Качество регрессии
MAE80%
Средняя абсолютная ошибка · МетрикиСреднее абсолютных отклонений — метрика в единицах целевой переменной, устойчивая к выбросам.
RMSE80%
Корень из среднеквадратичной ошибки · МетрикиКорень из MSE — возвращает метрику в исходные единицы, сохраняя штраф за большие ошибки.
MAPE80%
Средняя абсолютная процентная ошибка · МетрикиОтносительная ошибка в процентах — удобна для сравнения рядов разного масштаба.
SMAPE80%
Симметричная MAPE · МетрикиВариант MAPE с нормировкой на сумму факта и прогноза — частично лечит асимметрию.
R²80%
Коэффициент детерминации · МетрикиДоля дисперсии целевой переменной, объяснённая моделью, относительно константного прогноза.
Adjusted R²80%
Скорректированный R² · МетрикиR² со штрафом за число признаков — падает, если новый признак не приносит пользы.
Linear Regression80%
Линейная регрессия · Классическое машинное обучениеПредсказывает число как взвешенную сумму признаков. Самый интерпретируемый бейзлайн и основа для более сложных моделей.
Loss functions80%
Функции потерь · Глубокое обучениеФормализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.