Обучение с подкреплением

Discounting and Horizon

Дисконтирование и горизонт

актуальноТекущий рабочий стандарт

Направления: Продвинутый ML · Обучение с подкреплением

Коэффициент γ решает, насколько агент дальновиден. Он же делает бесконечную сумму наград конечной и стабилизирует обучение.

Обозначения
  • награда, полученная агентом на шаге
  • номер или количество: индекс шага, число соседей, кластеров или позиций
— сумма будущих наград с убывающим весом

Ключевые тезисы

  • Эффективный примерно 1/(1−γ): при γ = 0,99 агент смотрит на сотню шагов вперёд.
  • Малое γ ускоряет сходимость, но делает агента близоруким; большое — наоборот.
  • γ — не свойство задачи, а обучения: оптимальная при γ = 1 может быть недостижима.

Видеолекции

Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.

Следующий шагСобрать учебную программуПорядок изучения под роль и уровень: недели, отметка «пройдено» и повторение по расписанию.Перейти →

Глава «Обучение с подкреплением» последний раз правилась . Нашли ошибку — напишите.