Системный дизайн ML-сервисов

Experiment Infrastructure

Инфраструктура экспериментов

актуальноТекущий рабочий стандарт

Механика раскатки: разделение трафика, стабильные группы, метрики и автоматический откат.

Ключевые тезисы

  • Разбиение по стабильному хешу идентификатора: пользователь не должен прыгать между группами.
  • Shadow-режим считает предсказания новой модели, не показывая их, — безопасная проверка на реальном трафике.
  • Автооткат по guardrail-метрикам (ошибки, задержка, выручка) должен срабатывать без человека.
Тема также относится к главам:Оценка моделейСтатистика

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Механика разделения трафика

Стабильность групп важнее равномерности.

bucket = int(hashlib.md5(f"{experiment_id}:{user_id}".encode()).hexdigest(), 16) % 100
group = "test" if bucket < 50 else "control"
  • Хеш включает идентификатор эксперимента — иначе пользователь всегда попадает в одну и ту же половину во всех тестах.
  • Группа должна быть стабильна во времени: перескок между вариантами портит и опыт, и статистику.
  • Для связанных пользователей (семьи, компании) нужна кластерная рандомизация.
2

Guardrail-метрики и автооткат

Что должно останавливать эксперимент без человека.

  • Технические: доля ошибок, p99 задержки, доля фолбэков.
  • Продуктовые: выручка, конверсия, жалобы.
  • Правило: превышение порога по guardrail — автоматический откат, независимо от целевой метрики.
  • Shadow-режим перед канарейкой снимает большую часть рисков заранее.
фолд 1
фолд 2
фолд 3
фолд 4
фолд 5
обучение валидация
обучений модели5
доля валидации20%
схемаK-Fold
Схема разбиения
Офлайн-валидация отвечает на вопрос «работает ли модель», A/B — «нужна ли она продукту»

Связанные темы

Решения в условиях неопределённости · Онлайн-эксперименты

A/B testing97%

A/B-тестирование · Оценка моделей

Онлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.

Hypothesis testing85%

Проверка гипотез · Оценка моделей

Формальная процедура принятия решения на основе данных: нулевая гипотеза, статистика, уровень значимости.

Statistical significance85%

Статистическая значимость · Оценка моделей

Проверка, что разница между моделями не объясняется случайностью выборки.

Binomial & Bernoulli85%

Бернулли и биномиальное · Теория вероятностей и распределения

Один успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.

Central Limit Theorem85%

Центральная предельная теорема · Теория вероятностей и распределения

Сумма большого числа независимых слагаемых со сравнимым вкладом распределена приближённо нормально.

Multi-armed Bandits80%

Многорукие бандиты · Обучение с подкреплением

Упрощённый RL без состояний: выбираем действие, получаем награду и балансируем исследование с эксплуатацией.

Offline RL80%

Оффлайн RL · Обучение с подкреплением

Обучение политики по логам прошлых взаимодействий, без возможности экспериментировать со средой.

Beta Distribution80%

Бета-распределение · Теория вероятностей и распределения

Распределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.

Bayesian Optimization80%

Байесовская оптимизация · Практика ML

Строит модель зависимости метрики от гиперпараметров и выбирает следующую точку осознанно.