Обучение с подкреплением

Reward Design

Дизайн функции награды

актуальноТекущий рабочий стандарт

Направления: Продвинутый ML · Обучение с подкреплением

Агент оптимизирует то, что вы измерили, а не то, что имели в виду. Награда — самая опасная часть постановки: ошибка здесь не чинится ни алгоритмом, ни вычислениями.

Ключевые тезисы

  • (успех только в конце) — главная причина, почему агент ничему не учится.
  • ускоряет обучение, но легко порождает стратегию, эксплуатирующую саму награду.
  • Потенциальный shaping — единственная форма, доказуемо не меняющая оптимальную .

Подробный разбор

2 подтемы — объяснения, формулы, примеры и интерактивные графики.

В задаче «дойти до цели» естественно давать награду только за достижение цели. Проблема в том, что случайный агент до неё не доходит никогда: все траектории получают ноль, нет, учиться не на чем.

Тесно связанная трудность — назначение заслуги (). Даже когда цель случайно достигнута через двести шагов, непонятно, какие из этих двухсот действий были полезными, а какие случайными.

  • Curriculum: начинать с простых вариантов задачи и усложнять.
  • Демонстрации: подмешивать в буфер человеческие траектории.
  • Внутренняя мотивация: награда за новизну состояния, чтобы агент вообще куда-то дошёл.
  • Hindsight replay: считать достигнутое состояние целью задним числом — тогда каждая траектория чему-то учит.

Естественный ход — добавить промежуточную награду: не только за цель, но и за приближение к ней. Обучение резко ускоряется. Опасность в том, что агент оптимизирует именно то, что вы написали.

Лодка, которая ездит кругами

В гоночной игре агенту дали награду за очки, а очки давали за прохождение чекпоинтов и за бонусы на трассе. Оптимальной стратегией оказалось не финишировать: агент нашёл участок, где бонусы возрождаются, и крутился там, набирая очки бесконечно. Формально он решил поставленную задачу идеально. Ошибка была не в алгоритме, а в том, что «выиграть гонку» и «набрать очки» — разные цели, и вторая измерялась, а первая имелась в виду.

Единственная форма, доказуемо безопасная, — потенциальный shaping: дополнительная награда вида для произвольной функции . Она не меняет множество оптимальных политик, потому что суммируется в телескоп и на замкнутых траекториях даёт ноль.

Обозначения
  • коэффициент дисконтирования: насколько важна отложенная награда
  • состояние среды и выбранное в нём действие
На практике

Проверка простая: если существует поведение, набирающее много награды и очевидно не решающее задачу, награда сформулирована неверно. Искать такое поведение надо самому, до обучения, — иначе его найдёт агент.

Видеолекции

Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.

Следующий шагСобрать учебную программуПорядок изучения под роль и уровень: недели, отметка «пройдено» и повторение по расписанию.Перейти →

Глава «Обучение с подкреплением» последний раз правилась . Нашли ошибку — напишите.