Агент строит модель среды и планирует в ней вместо того, чтобы учиться только на реальном опыте. Дороже по вычислениям, зато на порядки экономнее по взаимодействиям.
Ключевые тезисы
- — главный аргумент: реальное взаимодействие бывает дорогим или опасным.
- Ошибки модели накапливаются при длинном прогнозе, поэтому планируют на короткий и перепланируют.
- Dyna, и обучаемые — три способа использовать модель для принятия решений.
Видеолекции
Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.
14:58Сравнение RL и Model Predictive Control0:26Введение в лекцию: Planning и Model-Based RL47:44Ограничения Vanilla DQN и sample efficiency1:39:18Сравнение sample efficiency TRPO и A2C37:10Model-Based vs Model-Free подходы в RL
Собрать учебную программуГлава «Обучение с подкреплением» последний раз правилась . Нашли ошибку — напишите.