Сумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.
- сумма наблюдений минус её ожидание — центрируем
- нормируем на разброс суммы: он растёт как корень из n, а не как n
- предел — стандартное нормальное распределение. Требуется конечная дисперсия, иначе теорема не работает
Ключевые тезисы
- Объясняет, почему нормальное распределение встречается так часто.
- Требует конечной дисперсии: при тяжёлых хвостах сходимость нарушается или крайне медленна.
- Обосновывает t-тесты, доверительные интервалы и нормальные приближения в A/B-тестах.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Когда ЦПТ не помогает
Условия, о которых обычно забывают.
- Бесконечная дисперсия: при степенном хвосте с сходимость идёт не к нормальному, а к устойчивому распределению.
- Зависимые наблюдения: в рядах и в сетевых данных эффективный размер выборки намного меньше номинального.
- Один доминирующий вклад: если одно слагаемое сравнимо с суммой остальных, нормальности не будет.
2ЦПТ и A/B-тесты
Почему нормальное приближение обычно работает для конверсий.
Конверсия — среднее бернуллиевских величин, поэтому при достаточном числе наблюдений её распределение близко к нормальному. Но для метрик с тяжёлым хвостом (выручка на пользователя) приближение подводит, и там применяют бутстрэп или трансформации.
Практическое правило: если 1% пользователей даёт 50% метрики, не полагайтесь на t-тест — используйте бутстрэп или переходите к устойчивым метрикам.
Связанные темы
Онлайн-эксперименты · Предельные теоремы
Experiment Infrastructure85%
Инфраструктура экспериментов · Системный дизайн ML-сервисовМеханика раскатки: разделение трафика, стабильные группы, метрики и автоматический откат.
A/B testing85%
A/B-тестирование · Оценка моделейОнлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.
Hypothesis testing85%
Проверка гипотез · Оценка моделейФормальная процедура принятия решения на основе данных: нулевая гипотеза, статистика, уровень значимости.
Statistical significance85%
Статистическая значимость · Оценка моделейПроверка, что разница между моделями не объясняется случайностью выборки.
Binomial & Bernoulli85%
Бернулли и биномиальное · Теория вероятностей и распределенияОдин успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.
Law of Large Numbers80%
Закон больших чисел · Теория вероятностей и распределенияСреднее по выборке сходится к математическому ожиданию при росте числа наблюдений.
Heavy Tails80%
Тяжёлые хвосты · Теория вероятностей и распределенияРаспределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.
Series and Convergence80%
Ряды и сходимость · Математический анализКогда бесконечная сумма имеет конечное значение и с какой скоростью алгоритм приближается к ответу.
Limits and Continuity80%
Пределы и непрерывность · Математический анализПредел описывает, к чему стремится функция вблизи точки. На этом понятии держатся производная, интеграл и вся теория сходимости алгоритмов.
Confidence intervals80%
Доверительные интервалы · Оценка моделейПоказывают точность оценки метрики; одно число без интервала мало о чём говорит.
Bootstrap80%
Бутстрэп · Оценка моделейМногократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.
Statistics80%
Статистика · ОсновыКак от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.