Обучение с подкреплением

Exploration in RL

Исследование среды

актуальноТекущий рабочий стандарт

Направления: Продвинутый ML · Обучение с подкреплением

Агент не может узнать о награде, которой не пробовал. Баланс между использованием известного и проверкой неизвестного — центральная трудность всего .

Ключевые тезисы

  • проста и работает, но исследует вслепую: в средах с разреженной наградой бесполезна.
  • Оптимизм при неопределённости и бонусы за новизну направляют исследование туда, где мало знаний.
  • и шум в параметрах дают исследование, согласованное во времени.

Подробный разбор

2 подтемы — объяснения, формулы, примеры и интерактивные графики.

С вероятностью ε агент действует случайно, иначе — жадно по текущей оценке. Приём прост, не требует ничего дополнительного и в простых средах работает.

Предел наступает в средах, где до награды надо сделать длинную осмысленную последовательность действий. Случайные тычки такой последовательности не породят: вероятность угадать сто правильных действий подряд равна нулю практически.

На практике

Отдельная беда — несогласованность во времени: агент случаен на каждом шаге независимо, поэтому его блуждание похоже на дрожание на месте, а не на исследование новых областей.

ПодходИдеяГде работает
Оптимизм при неопределённостинепроверенным действиям приписывается высокая ценностьтабличные и небольшие среды
Бонус за новизнунаграда за редко посещаемые состояния, большие пространства
штраф за слишком уверенную непрерывное управление, SAC
Шум в параметрахвозмущаются веса, а не действиянужна согласованность во времени

Ключевое отличие последних двух строк от ε-жадности — согласованность. Шум в параметрах даёт , которая ведёт себя необычно, но последовательно на протяжении эпизода: агент пробует другую стратегию, а не дёргается случайно.

На практике

Бонус за новизну — обоюдоострый инструмент. В средах с шумом («телевизор со статикой») он приводит к тому, что агент бесконечно смотрит на случайный шум: тот всегда нов. Отсюда методы, измеряющие не новизну наблюдения, а предсказуемость динамики.

Видеолекции

Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.

Следующий шагСобрать учебную программуПорядок изучения под роль и уровень: недели, отметка «пройдено» и повторение по расписанию.Перейти →

Глава «Обучение с подкреплением» последний раз правилась . Нашли ошибку — напишите.