Учимся на данных своей текущей или на чужих. Разделение определяет, можно ли переиспользовать старый опыт, — и отсюда всю архитектуру алгоритма.
Ключевые тезисы
- данные устаревают сразу после обновления : их выбрасывают.
- позволяет учиться на буфере старого опыта — отсюда DQN и SAC.
- Расплата — смещение: распределение данных не совпадает с текущей политикой.
Видеолекции
Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.
12:05On-policy и off-policy алгоритмы1:22:27On-policy и off-policy алгоритмы2:33Повторение различий on-policy и off-policy алгоритмов46:28Importance sampling для замены распределений13:09Одношаговые оценки и off-policy обучение45:43Дилемма синхронизации весов (on-policy vs off-policy)
Собрать учебную программуГлава «Обучение с подкреплением» последний раз правилась . Нашли ошибку — напишите.