Обучение с подкреплением

On-policy and Off-policy

On-policy и off-policy

актуальноТекущий рабочий стандарт

Направления: Продвинутый ML · Обучение с подкреплением

Учимся на данных своей текущей или на чужих. Разделение определяет, можно ли переиспользовать старый опыт, — и отсюда всю архитектуру алгоритма.

Ключевые тезисы

  • данные устаревают сразу после обновления : их выбрасывают.
  • позволяет учиться на буфере старого опыта — отсюда DQN и SAC.
  • Расплата — смещение: распределение данных не совпадает с текущей политикой.

Видеолекции

Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.

Следующий шагСобрать учебную программуПорядок изучения под роль и уровень: недели, отметка «пройдено» и повторение по расписанию.Перейти →

Глава «Обучение с подкреплением» последний раз правилась . Нашли ошибку — напишите.