Упрощённый RL без состояний: выбираем действие, получаем награду и балансируем исследование с эксплуатацией.
Ключевые тезисы
- Thompson sampling и UCB — два рабочих алгоритма с теоретическими гарантиями.
- Контекстные бандиты учитывают признаки пользователя — это уже полноценная рекомендательная модель.
- В отличие от A/B-теста, бандит минимизирует потери во время эксперимента.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1UCB и Thompson sampling
Два способа балансировать исследование и эксплуатацию.
- среднее значение
- число объектов в выборке
- логарифм: превращает произведения в суммы и сжимает масштаб
Thompson sampling делает то же самое вероятностно: сэмплирует значение из апостериорного распределения каждой руки и выбирает максимум. На практике обычно работает не хуже UCB и проще настраивается.
2Бандит против A/B-теста
Когда что уместно.
| A/B-тест | Бандит | |
|---|---|---|
| Цель | измерить эффект | максимизировать награду |
| Потери во время эксперимента | высокие | низкие |
| Статистический вывод | строгий | сложнее |
| Когда выбирать | нужно решение и цифра | нужен результат здесь и сейчас |
Контекстные бандиты — мост к рекомендациям: выбор варианта зависит от признаков пользователя, и модель обучается онлайн.
Связанные темы
Решения в условиях неопределённости
Offline RL80%
Оффлайн RL · Обучение с подкреплениемОбучение политики по логам прошлых взаимодействий, без возможности экспериментировать со средой.
Beta Distribution80%
Бета-распределение · Теория вероятностей и распределенияРаспределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.
A/B testing80%
A/B-тестирование · Оценка моделейОнлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.
Experiment Infrastructure80%
Инфраструктура экспериментов · Системный дизайн ML-сервисовМеханика раскатки: разделение трафика, стабильные группы, метрики и автоматический откат.
Bayesian Optimization80%
Байесовская оптимизация · Практика MLСтроит модель зависимости метрики от гиперпараметров и выбирает следующую точку осознанно.