Онлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.
Ключевые тезисы
- Размер выборки считается до запуска, а не после.
- Подглядывание в результаты по ходу теста раздувает ошибку I рода.
- Офлайн-метрика и бизнес-метрика расходятся чаще, чем хотелось бы.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Дизайн эксперимента
Размер выборки, метрика и длительность считаются заранее.
- стандартное отклонение — разброс величины
- уровень значимости — допустимая вероятность ложного открытия
- вероятность ошибки II рода (единица минус мощность)
- приращение — малое изменение величины
- число объектов в выборке
Конверсия 5%, хотим заметить прирост в 0.5 п.п. при и мощности 80% — нужно порядка 30 000 пользователей на группу. Если трафика меньше, эксперимент бессмысленно запускать: он не различит такой эффект.
2Типичные ошибки
Подглядывание, метрики-прокси и нарушение независимости.
- Подглядывание: остановка теста в момент, когда p < 0.05, увеличивает ошибку I рода в несколько раз. Нужны заранее фиксированный срок или последовательные тесты.
- Сетевые эффекты: пользователи взаимодействуют между собой (соцсети, маркетплейсы) — независимость нарушена, нужна кластерная рандомизация.
- Не та метрика: рост CTR при падении выручки — классический результат оптимизации прокси-метрики.
- Новизна: первые дни поведение меняется просто из-за смены интерфейса; смотрите на стабилизировавшийся период.
Офлайн-метрика и продуктовый эффект связаны слабо. Прирост ROC-AUC на 0.01 может дать нулевую разницу в деньгах, а иногда и отрицательную.
Связанные темы
Решения в условиях неопределённости · Онлайн-эксперименты · Эксперименты и статистика
Experiment Infrastructure97%
Инфраструктура экспериментов · Системный дизайн ML-сервисовМеханика раскатки: разделение трафика, стабильные группы, метрики и автоматический откат.
Hypothesis testing96%
Проверка гипотез · Оценка моделейФормальная процедура принятия решения на основе данных: нулевая гипотеза, статистика, уровень значимости.
Statistical significance96%
Статистическая значимость · Оценка моделейПроверка, что разница между моделями не объясняется случайностью выборки.
Binomial & Bernoulli85%
Бернулли и биномиальное · Теория вероятностей и распределенияОдин успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.
Central Limit Theorem85%
Центральная предельная теорема · Теория вероятностей и распределенияСумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.
Multi-armed Bandits80%
Многорукие бандиты · Обучение с подкреплениемУпрощённый RL без состояний: выбираем действие, получаем награду и балансируем исследование с эксплуатацией.
Offline RL80%
Оффлайн RL · Обучение с подкреплениемОбучение политики по логам прошлых взаимодействий, без возможности экспериментировать со средой.
Beta Distribution80%
Бета-распределение · Теория вероятностей и распределенияРаспределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.
Bayesian Optimization80%
Байесовская оптимизация · Практика MLСтроит модель зависимости метрики от гиперпараметров и выбирает следующую точку осознанно.
Confidence intervals75%
Доверительные интервалы · Оценка моделейПоказывают точность оценки метрики; одно число без интервала мало о чём говорит.
Bootstrap75%
Бутстрэп · Оценка моделейМногократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.
Ablation studies75%
Абляционные исследования · Оценка моделейПоочерёдное отключение компонентов, чтобы понять, что именно даёт прирост качества.
Statistics75%
Статистика · ОсновыКак от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.