Оценка моделей

Confidence intervals

Доверительные интервалы

актуальноТекущий рабочий стандарт

Показывают точность оценки метрики; одно число без интервала мало о чём говорит.

Что означает каждый компонент
  • точечная оценка — то самое число, которое вы посчитали на тесте
  • квантиль нормального распределения для 95% уровня доверия
  • стандартная ошибка: падает как корень из объёма выборки. Вчетверо больше данных — вдвое уже интервал

Ключевые тезисы

  • Ширина интервала падает примерно как 1/√n.
  • Пересекающиеся интервалы двух моделей — повод не спешить с выводами.
  • Бутстрэп-интервалы работают там, где аналитическая формула недоступна.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Как построить интервал для метрики

Аналитически, бутстрэпом или по фолдам.

Обозначения
  • оценка параметра по выборке
  • стандартное отклонение — разброс величины
  • параметры модели
  • число объектов в выборке
Нормальное приближение — работает при больших и не работает для AUC и медиан

Для метрик со сложным распределением (AUC, F1, NDCG) надёжнее бутстрэп-интервал по перцентилям. Для оценки по кросс-валидации интервал строят по разбросу фолдов, помня, что фолды не независимы.

На практике

Правило большого пальца: ширина интервала падает как . Чтобы сузить интервал вдвое, нужно вчетверо больше тестовых данных — иногда это дешевле, чем месяц улучшений модели.

2

Сколько нужно тестовых данных

Обратная задача: от желаемой точности к размеру выборки.

Обозначения
  • стандартное отклонение — разброс величины
  • число объектов в выборке
Пример

Хотим оценить accuracy с точностью ±1 п.п. при ожидаемом значении около 0.9: , значит объектов.

На практике

Это часто вскрывает неприятную правду: тест на 300 объектов не способен различить модели, отличающиеся на 2 процентных пункта.

Связанные темы

Предельные теоремы · Эксперименты и статистика

Bootstrap95%

Бутстрэп · Оценка моделей

Многократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.

Statistics95%

Статистика · Основы

Как от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.

Law of Large Numbers80%

Закон больших чисел · Теория вероятностей и распределения

Среднее по выборке сходится к математическому ожиданию при росте числа наблюдений.

Central Limit Theorem80%

Центральная предельная теорема · Теория вероятностей и распределения

Сумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.

Heavy Tails80%

Тяжёлые хвосты · Теория вероятностей и распределения

Распределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.

Series and Convergence80%

Ряды и сходимость · Математический анализ

Когда бесконечная сумма имеет конечное значение и с какой скоростью алгоритм приближается к ответу.

Limits and Continuity80%

Пределы и непрерывность · Математический анализ

Предел описывает, к чему стремится функция вблизи точки. На этом понятии держатся производная, интеграл и вся теория сходимости алгоритмов.

Statistical significance75%

Статистическая значимость · Оценка моделей

Проверка, что разница между моделями не объясняется случайностью выборки.

Hypothesis testing75%

Проверка гипотез · Оценка моделей

Формальная процедура принятия решения на основе данных: нулевая гипотеза, статистика, уровень значимости.

A/B testing75%

A/B-тестирование · Оценка моделей

Онлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.

Ablation studies75%

Абляционные исследования · Оценка моделей

Поочерёдное отключение компонентов, чтобы понять, что именно даёт прирост качества.