Обучение с подкреплением

Advantage Function

Функция преимущества

актуальноТекущий рабочий стандарт

Направления: Продвинутый ML · Обучение с подкреплением

Насколько действие лучше среднего в этом состоянии. Вычитание базовой линии не меняет в среднем, но резко снижает его .

Обозначения
  • состояние среды и выбранное в нём действие
  • ожидаемая суммарная награда за действие a в состоянии s
  • ожидаемая суммарная награда из состояния s
  • матрица преобразования
Преимущество: положительное — действие лучше среднего, отрицательное — хуже

Ключевые тезисы

  • A(s,a) = Q(s,a) − V(s): ценность действия относительно состояния, а не сама по себе.
  • — главный приём снижения в policy-градиентных методах.
  • даёт настраиваемый компромисс между смещением и через параметр λ.

Видеолекции

Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.

Следующий шагСобрать учебную программуПорядок изучения под роль и уровень: недели, отметка «пройдено» и повторение по расписанию.Перейти →

Глава «Обучение с подкреплением» последний раз правилась . Нашли ошибку — напишите.