Как от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.
Ключевые тезисы
- Смещение и дисперсия оценки — тот же компромисс, что и bias–variance в машинном обучении.
- Доверительный интервал говорит о точности оценки, а p-value — о совместимости данных с нулевой гипотезой.
- Статистика даёт инструменты для честного сравнения моделей и A/B-тестов.
Подробный разбор
3 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Оценки: от выборки к генеральной совокупности
Почему среднее по 100 наблюдениям — это не «истина», а случайная величина.
Мы никогда не видим всю совокупность — только выборку. Любая статистика, посчитанная по выборке (среднее, доля, AUC модели), сама случайна: на другой выборке она была бы другой. Хорошая оценка несмещена () и имеет малый разброс.
- дисперсия — мера разброса значений
- стандартное отклонение — разброс величины
- среднее значение
- объект или аргумент функции
- число объектов в выборке
- суммирование по всем перечисленным элементам
Модель показала ROC-AUC 0.81 на тесте из 500 объектов. Бутстрэп даёт 95%-й интервал примерно . Значит, конкурирующая модель с AUC 0.83 не обязательно лучше — разница внутри шума.
2Проверка гипотез и p-value
Что на самом деле означает «результат статистически значим».
Формулируется нулевая гипотеза («разницы нет»), считается статистика, и оценивается: насколько вероятно получить такие или более экстремальные данные, если верна. Эта вероятность и есть p-value.
- p-value — это не вероятность того, что гипотеза верна, и не размер эффекта.
- Ошибка I рода — «нашли эффект, которого нет»; уровень (обычно 0.05) её контролирует.
- Ошибка II рода — «не заметили реальный эффект»; её контролирует мощность, зависящая от размера выборки.
- 20 проверок подряд при дают в среднем одно ложное открытие — нужна поправка на множественные сравнения.
В A/B-тестах самая частая ошибка — «подглядывание»: смотреть результат каждый день и остановиться, как только p < 0.05. Так уровень ошибки I рода вырастает в разы. Размер выборки считается заранее.
3Форма распределения и выбор метрики
Среднее, медиана и хвосты: почему для зарплат нельзя брать MSE.
У симметричных распределений среднее и медиана совпадают. У скошенных (доходы, длительность сессий, цены) среднее уезжает в хвост. Метрика, оптимальная для среднего (MSE), в этом случае заставит модель систематически завышать прогноз.
| Свойство данных | Что выбрать |
|---|---|
| Симметричные, без выбросов | MSE / RMSE, оптимум — среднее |
| Тяжёлые хвосты, выбросы | MAE (оптимум — медиана) или Huber |
| Логнормальная цель (цены, доходы) | логарифмирование цели, затем RMSE |
| Счётные данные (число заказов) | распределение Пуассона, Poisson loss |
Связанные темы
Предельные теоремы · Вероятность и информация · Эксперименты и статистика
Confidence intervals95%
Доверительные интервалы · Оценка моделейПоказывают точность оценки метрики; одно число без интервала мало о чём говорит.
Bootstrap95%
Бутстрэп · Оценка моделейМногократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.
Law of Large Numbers80%
Закон больших чисел · Теория вероятностей и распределенияСреднее по выборке сходится к математическому ожиданию при росте числа наблюдений.
Central Limit Theorem80%
Центральная предельная теорема · Теория вероятностей и распределенияСумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.
Heavy Tails80%
Тяжёлые хвосты · Теория вероятностей и распределенияРаспределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.
Series and Convergence80%
Ряды и сходимость · Математический анализКогда бесконечная сумма имеет конечное значение и с какой скоростью алгоритм приближается к ответу.
Limits and Continuity80%
Пределы и непрерывность · Математический анализПредел описывает, к чему стремится функция вблизи точки. На этом понятии держатся производная, интеграл и вся теория сходимости алгоритмов.
Statistical significance75%
Статистическая значимость · Оценка моделейПроверка, что разница между моделями не объясняется случайностью выборки.
Hypothesis testing75%
Проверка гипотез · Оценка моделейФормальная процедура принятия решения на основе данных: нулевая гипотеза, статистика, уровень значимости.
A/B testing75%
A/B-тестирование · Оценка моделейОнлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.
Ablation studies75%
Абляционные исследования · Оценка моделейПоочерёдное отключение компонентов, чтобы понять, что именно даёт прирост качества.
Probability70%
Теория вероятностей · ОсновыЯзык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.
Information Theory70%
Теория информации · ОсновыИзмеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.
Probability Distribution70%
Распределение вероятностей · Математический справочникЗакон, задающий вероятности значений случайной величины.
Expectation70%
Математическое ожидание · Математический справочникСреднее значение случайной величины по её распределению.
Variance70%
Дисперсия · Математический справочникМера разброса значений вокруг среднего.
Covariance70%
Ковариация · Математический справочникМера совместной изменчивости двух величин; корреляция — её нормированная версия.
Entropy70%
Энтропия · Математический справочникМера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.
KL Divergence70%
KL-дивергенция · Математический справочникНасколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.
Cross-Entropy70%
Кросс-энтропия · Математический справочникОжидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).
Bayes Theorem70%
Теорема Байеса · Математический справочникПравило пересчёта вероятности гипотезы после получения новых данных.
Naive Bayes70%
Наивный байесовский классификатор · Классическое машинное обучениеПрименяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.
Log Loss70%
Логарифмические потери · МетрикиОценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.