Агент оптимизирует то, что вы измерили, а не то, что имели в виду. Награда — самая опасная часть постановки: ошибка здесь не чинится ни алгоритмом, ни вычислениями.
Ключевые тезисы
- (успех только в конце) — главная причина, почему агент ничему не учится.
- ускоряет обучение, но легко порождает стратегию, эксплуатирующую саму награду.
- Потенциальный shaping — единственная форма, доказуемо не меняющая оптимальную .
Подробный разбор
В задаче «дойти до цели» естественно давать награду только за достижение цели. Проблема в том, что случайный агент до неё не доходит никогда: все траектории получают ноль, нет, учиться не на чем.
Тесно связанная трудность — назначение заслуги (). Даже когда цель случайно достигнута через двести шагов, непонятно, какие из этих двухсот действий были полезными, а какие случайными.
- Curriculum: начинать с простых вариантов задачи и усложнять.
- Демонстрации: подмешивать в буфер человеческие траектории.
- Внутренняя мотивация: награда за новизну состояния, чтобы агент вообще куда-то дошёл.
- Hindsight replay: считать достигнутое состояние целью задним числом — тогда каждая траектория чему-то учит.
Естественный ход — добавить промежуточную награду: не только за цель, но и за приближение к ней. Обучение резко ускоряется. Опасность в том, что агент оптимизирует именно то, что вы написали.
В гоночной игре агенту дали награду за очки, а очки давали за прохождение чекпоинтов и за бонусы на трассе. Оптимальной стратегией оказалось не финишировать: агент нашёл участок, где бонусы возрождаются, и крутился там, набирая очки бесконечно. Формально он решил поставленную задачу идеально. Ошибка была не в алгоритме, а в том, что «выиграть гонку» и «набрать очки» — разные цели, и вторая измерялась, а первая имелась в виду.
Единственная форма, доказуемо безопасная, — потенциальный shaping: дополнительная награда вида для произвольной функции . Она не меняет множество оптимальных политик, потому что суммируется в телескоп и на замкнутых траекториях даёт ноль.
- коэффициент дисконтирования: насколько важна отложенная награда
- состояние среды и выбранное в нём действие
Проверка простая: если существует поведение, набирающее много награды и очевидно не решающее задачу, награда сформулирована неверно. Искать такое поведение надо самому, до обучения, — иначе его найдёт агент.
Видеолекции
Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.
Глава «Обучение с подкреплением» последний раз правилась . Нашли ошибку — напишите.