Оценка моделей

Leave-One-Out

Leave-One-Out

классикаТолько для очень маленьких выборок.

Предельный случай: валидация состоит ровно из одного объекта, и так N раз.

Ключевые тезисы

  • Почти несмещённая оценка, но с высокой дисперсией.
  • Вычислительно дорога — N обучений модели.
  • Имеет смысл только на очень маленьких выборках.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Компромисс LOO

Максимум данных на обучение, максимум дисперсии оценки.

LOO — это K-Fold при . Каждая модель обучается почти на всей выборке, поэтому смещение оценки минимально. Но обучающие выборки почти идентичны друг другу, оценки сильно коррелированы, и итоговая дисперсия оказывается высокой.

  • Стоимость: обучений — приемлемо только при малых .
  • Для линейной регрессии есть аналитическая формула LOO без переобучения (через матрицу шляпы).
  • На практике 5 или 10 фолдов почти всегда предпочтительнее.
2

Родственные схемы

Leave-one-group-out и leave-p-out.

  • Leave-one-group-out: по очереди исключаем целую группу — больницу, город, производственную линию. Так проверяется перенос на новый объект того же типа.
  • Leave-p-out: исключаем объектов; число комбинаций растёт комбинаторно, применяется редко.
  • Nested CV: внешняя петля для оценки, внутренняя для подбора гиперпараметров — единственный честный способ отчитаться о качестве после тюнинга.

Связанные темы

Утечки и честная валидация

Data leakage85%

Утечка данных · Данные

Ситуация, когда в обучении присутствует информация, недоступная в момент реального предсказания. Главная причина «слишком хороших» метрик.

Train / Validation / Test split85%

Разбиение выборки · Данные

Train учит, validation настраивает гиперпараметры, test даёт единственную честную оценку — и используется один раз.

Data leakage85%

Утечка данных · Практика ML

Самая дорогая ошибка в ML: модель отлично работает офлайн и разваливается в проде.

Cross-validation85%

Кросс-валидация · Оценка моделей

Многократное разбиение выборки, дающее оценку качества вместе с её разбросом.

K-Fold85%

K-Fold · Оценка моделей

Данные делятся на K частей; каждая по очереди становится валидационной.

Stratified K-Fold85%

Стратифицированный K-Fold · Оценка моделей

K-Fold с сохранением пропорции классов в каждом фолде.

Bootstrap85%

Бутстрэп · Оценка моделей

Многократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.

Normalization & Standardization85%

Нормализация и стандартизация · Данные

Приведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.