Оценка моделей

Statistical significance

Статистическая значимость

актуальноТекущий рабочий стандарт

Проверка, что разница между моделями не объясняется случайностью выборки.

Ключевые тезисы

  • Парные тесты на одних и тех же фолдах мощнее независимых.
  • Множественные сравнения требуют поправки (Бонферрони, FDR).
  • Значимость ≠ практическая важность: смотрите на размер эффекта.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Парное сравнение моделей

Сравнивать нужно на одних и тех же фолдах.

Если обе модели оценены на одинаковых разбиениях, разница метрик по фолдам образует парную выборку. Парный тест мощнее независимого: он убирает вклад «сложности» конкретного фолда.

  • Малое число фолдов → используйте перестановочный тест или бутстрэп разницы, а не t-тест.
  • Для классификаторов на одном тесте есть тест МакНемара по таблице несовпадений.
  • 5x2cv-тест специально сконструирован для сравнения алгоритмов обучения.
2

Множественные сравнения

Чем больше моделей вы сравниваете, тем больше ложных находок.

При и это уже 64%
  • Бонферрони: сравнивать p-value с — просто и консервативно.
  • Бенджамини — Хохберг: контролирует долю ложных открытий, мощнее при большом .
  • Практический совет: заранее определите одну главную метрику и одну главную гипотезу.

Связанные темы

Онлайн-эксперименты · Эксперименты и статистика

A/B testing96%

A/B-тестирование · Оценка моделей

Онлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.

Hypothesis testing96%

Проверка гипотез · Оценка моделей

Формальная процедура принятия решения на основе данных: нулевая гипотеза, статистика, уровень значимости.

Experiment Infrastructure85%

Инфраструктура экспериментов · Системный дизайн ML-сервисов

Механика раскатки: разделение трафика, стабильные группы, метрики и автоматический откат.

Binomial & Bernoulli85%

Бернулли и биномиальное · Теория вероятностей и распределения

Один успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.

Central Limit Theorem85%

Центральная предельная теорема · Теория вероятностей и распределения

Сумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.

Confidence intervals75%

Доверительные интервалы · Оценка моделей

Показывают точность оценки метрики; одно число без интервала мало о чём говорит.

Bootstrap75%

Бутстрэп · Оценка моделей

Многократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.

Ablation studies75%

Абляционные исследования · Оценка моделей

Поочерёдное отключение компонентов, чтобы понять, что именно даёт прирост качества.

Statistics75%

Статистика · Основы

Как от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.