Обучение с подкреплением

Multi-armed Bandits

Многорукие бандиты

актуальноТекущий рабочий стандарт

Упрощённый RL без состояний: выбираем действие, получаем награду и балансируем исследование с эксплуатацией.

Ключевые тезисы

  • Thompson sampling и UCB — два рабочих алгоритма с теоретическими гарантиями.
  • Контекстные бандиты учитывают признаки пользователя — это уже полноценная рекомендательная модель.
  • В отличие от A/B-теста, бандит минимизирует потери во время эксперимента.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

UCB и Thompson sampling

Два способа балансировать исследование и эксплуатацию.

Обозначения
  • среднее значение
  • число объектов в выборке
  • логарифм: превращает произведения в суммы и сжимает масштаб
Бонус за неопределённость: редко пробованные варианты получают преимущество

Thompson sampling делает то же самое вероятностно: сэмплирует значение из апостериорного распределения каждой руки и выбирает максимум. На практике обычно работает не хуже UCB и проще настраивается.

2

Бандит против A/B-теста

Когда что уместно.

A/B-тестБандит
Цельизмерить эффектмаксимизировать награду
Потери во время экспериментавысокиенизкие
Статистический выводстрогийсложнее
Когда выбиратьнужно решение и цифранужен результат здесь и сейчас
На практике

Контекстные бандиты — мост к рекомендациям: выбор варианта зависит от признаков пользователя, и модель обучается онлайн.

Связанные темы

Решения в условиях неопределённости