Обучение с подкреплением

Model-Based RL

Model-based методы

актуальноТекущий рабочий стандарт

Направления: Продвинутый ML · Обучение с подкреплением

Агент строит модель среды и планирует в ней вместо того, чтобы учиться только на реальном опыте. Дороже по вычислениям, зато на порядки экономнее по взаимодействиям.

Ключевые тезисы

  • — главный аргумент: реальное взаимодействие бывает дорогим или опасным.
  • Ошибки модели накапливаются при длинном прогнозе, поэтому планируют на короткий и перепланируют.
  • Dyna, и обучаемые — три способа использовать модель для принятия решений.

Видеолекции

Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.

Следующий шагСобрать учебную программуПорядок изучения под роль и уровень: недели, отметка «пройдено» и повторение по расписанию.Перейти →

Глава «Обучение с подкреплением» последний раз правилась . Нашли ошибку — напишите.