Насколько действие лучше среднего в этом состоянии. Вычитание базовой линии не меняет в среднем, но резко снижает его .
Обозначения
- состояние среды и выбранное в нём действие
- ожидаемая суммарная награда за действие a в состоянии s
- ожидаемая суммарная награда из состояния s
- матрица преобразования
Ключевые тезисы
- A(s,a) = Q(s,a) − V(s): ценность действия относительно состояния, а не сама по себе.
- — главный приём снижения в policy-градиентных методах.
- даёт настраиваемый компромисс между смещением и через параметр λ.
Видеолекции
Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.
18:24Преимущества Gaussian Splatting: демократичность11:52Graceful stop преимущества25:06Преимущества CLIP для мультимодальности19:14Преимущества GAE для снижения variance1:31:07Преимущества растеризации: аппаратное ускорение1:36:32Soft Actor-Critic: практическая реализация и преимущества
Собрать учебную программуГлава «Обучение с подкреплением» последний раз правилась . Нашли ошибку — напишите.