Обучение с подкреплением

Experience Replay

Буфер воспроизведения

актуальноТекущий рабочий стандарт

Направления: Продвинутый ML · Обучение с подкреплением

Опыт складывается в буфер и переиспользуется многократно в случайном порядке. Решает сразу две проблемы: соседних переходов и расточительность обучения.

Ключевые тезисы

  • Случайная выборка из буфера разрывает последовательных шагов — без этого сеть расходится.
  • Один переход используется многократно: растёт в разы.
  • Приоритизированный буфер чаще берёт переходы с большой TD-ошибкой, компенсируя смещение весами.

Подробный разбор

2 подтемы — объяснения, формулы, примеры и интерактивные графики.

  • Корреляция: соседние переходы почти одинаковы. Обучение на них подряд — то же, что обучать сеть на отсортированном датасете: она подстраивается под текущий кусок и забывает прошлый.
  • Расточительность: взаимодействие со средой дорого, а каждый переход используется ровно один раз и выбрасывается.

Буфер решает оба: переходы копятся, обучение берёт случайную выборку из всего накопленного. разрывается перемешиванием, а каждый переход используется многократно.

На практике

Приём работает только для алгоритмов. On-policy методам вроде старые данные не подходят: они собраны другой политикой, и обучение на них смещает .

Равномерная выборка тратит одинаково много на переходы, где сеть уже всё поняла. Приоритизация берёт переход с вероятностью, растущей с его TD-ошибкой: чаще показываем то, что предсказано плохо.

Обозначения
  • скорость обучения: насколько сильно новое наблюдение меняет оценку
  • малая величина: шум, допуск или защита от деления на ноль
  • приращение — малое изменение величины
  • вероятность перехода между состояниями
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • суммирование по всем перечисленным элементам

Но неравномерная выборка смещает оценку: мы учимся на распределении, отличном от истинного. Компенсируют это весами важности при обновлении — чем чаще берём переход, тем меньше его вес.

Обозначения
  • коэффициент сглаживания (инерции)
  • веса модели — то, что подбирается при обучении
  • число объектов в выборке
На практике

Параметр β поднимают от 0,4 к 1 по ходу обучения: в начале смещение терпимо ради скорости, в конце нужна несмещённость. Это тот случай, где расписание — не украшение, а часть метода.

Видеолекции

Записи университетских курсов, где эта тема звучит. Ссылка открывает запись с той секунды, где о ней говорят, — искать по трёхчасовой лекции не нужно.

Следующий шагСобрать учебную программуПорядок изучения под роль и уровень: недели, отметка «пройдено» и повторение по расписанию.Перейти →

Глава «Обучение с подкреплением» последний раз правилась . Нашли ошибку — напишите.