Оценка обновляется не по итоговой отдаче эпизода, а по следующему шагу плюс текущей оценке. Именно это делает применимым к длинным и незавершающимся задачам.
- награда, полученная агентом на шаге
- ожидаемая суммарная награда из состояния s
Ключевые тезисы
- — разница между предсказанием и «шаг реальности плюс предсказание дальше».
- вносит смещение, зато резко снижает по сравнению с методами Монте-Карло.
- и n-шаговые методы позволяют плавно двигаться между двумя крайностями.
Подробный разбор
Метод Монте-Карло ждёт конца эпизода и обновляет оценку по фактической отдаче. Это несмещённо, но требует завершённых эпизодов и даёт огромную : зависит от сотен случайных событий.
TD обновляет оценку сразу после шага, подставляя вместо неизвестного будущего собственную текущую оценку. Это и называется — опора на самого себя.
- реально полученная награда за шаг — единственный кусок настоящей информации
- собственная оценка ценности следующего состояния
- текущая оценка, которую и уточняем
| Монте-Карло | TD | |
|---|---|---|
| ждёт конца эпизода | да | нет |
| смещение | нет | есть |
| большая | малая | |
| работает без завершения | нет | да |
n-шаговые методы и позволяют выбрать точку между этими крайностями: чем больше шагов реальности берётся, тем ближе к Монте-Карло.
Видеолекции
Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.
Собрать учебную программуГлава «Обучение с подкреплением» последний раз правилась . Нашли ошибку — напишите.