Обучение с подкреплением

Temporal Difference Learning

Обучение по временным разностям

актуальноТекущий рабочий стандарт

Направления: Продвинутый ML · Обучение с подкреплением

Оценка обновляется не по итоговой отдаче эпизода, а по следующему шагу плюс текущей оценке. Именно это делает применимым к длинным и незавершающимся задачам.

Обозначения
  • награда, полученная агентом на шаге
  • ожидаемая суммарная награда из состояния s
: на неё и обновляют оценку

Ключевые тезисы

  • — разница между предсказанием и «шаг реальности плюс предсказание дальше».
  • вносит смещение, зато резко снижает по сравнению с методами Монте-Карло.
  • и n-шаговые методы позволяют плавно двигаться между двумя крайностями.

Подробный разбор

1 подтема — объяснения, формулы, примеры и интерактивные графики.

Метод Монте-Карло ждёт конца эпизода и обновляет оценку по фактической отдаче. Это несмещённо, но требует завершённых эпизодов и даёт огромную : зависит от сотен случайных событий.

TD обновляет оценку сразу после шага, подставляя вместо неизвестного будущего собственную текущую оценку. Это и называется — опора на самого себя.

Что означает каждый компонент
  • реально полученная награда за шаг — единственный кусок настоящей информации
  • собственная оценка ценности следующего состояния
  • текущая оценка, которую и уточняем
TD-ошибка: насколько «шаг реальности плюс прогноз» расходится с текущим прогнозом
Монте-КарлоTD
ждёт конца эпизодаданет
смещениенетесть
большаямалая
работает без завершениянетда
На практике

n-шаговые методы и позволяют выбрать точку между этими крайностями: чем больше шагов реальности берётся, тем ближе к Монте-Карло.

Видеолекции

Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.

Следующий шагСобрать учебную программуПорядок изучения под роль и уровень: недели, отметка «пройдено» и повторение по расписанию.Перейти →

Глава «Обучение с подкреплением» последний раз правилась . Нашли ошибку — напишите.