Off-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.
- скорость обучения: насколько сильно доверяем новому опыту
- цель: немедленная награда плюс дисконтированная лучшая ценность следующего состояния
- текущая оценка. Разность цели и оценки — TD-ошибка, она и двигает обучение
Ключевые тезисы
- Обновление использует max по действиям следующего состояния.
- ε-greedy балансирует исследование и эксплуатацию.
- В табличном виде сходится к оптимуму при достаточном исследовании.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Правило обновления
Off-policy обучение: учимся оптимуму, ведя себя исследовательски.
- скорость обучения: насколько сильно новое наблюдение меняет оценку
- коэффициент дисконтирования: насколько важна отложенная награда
- состояние среды и выбранное в нём действие
- награда, полученная агентом на шаге
- ожидаемая суммарная награда за действие a в состоянии s
Максимум по действиям следующего состояния означает, что мы обновляемся в сторону оптимальной политики, независимо от того, какое действие агент реально выбрал. Это и делает метод off-policy.
- ε-greedy: с вероятностью случайное действие, иначе жадное. обычно затухает со временем.
- В табличном виде метод сходится к оптимуму при бесконечном исследовании и убывающем .
- Максимум систематически переоценивает ценности — эту проблему решает Double Q-learning.
2Стратегии исследования
Как балансировать между «пробовать» и «использовать».
- ε-greedy с затуханием: от 1.0 в начале до 0.05 к концу обучения.
- Softmax / Boltzmann: вероятность действия пропорциональна — «почти хорошие» действия выбираются чаще плохих.
- UCB: бонус за редко пробованные действия, обоснованный доверительными интервалами.
- Внутренняя мотивация: награда за новизну состояния — спасает при разреженной внешней награде.
Связанные темы
Основы обучения с подкреплением
MDP85%
Марковский процесс принятия решений · Обучение с подкреплениемФормальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.
States / Actions / Rewards85%
Состояния, действия, награды · Обучение с подкреплениемТри базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.
Value Functions85%
Функции ценности · Обучение с подкреплениемV(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.
SARSA85%
SARSA · Обучение с подкреплениемOn-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.
Policy Gradient85%
Градиент политики · Обучение с подкреплениемПрямая оптимизация параметров политики по градиенту ожидаемой награды.
Actor-Critic85%
Актор-критик · Обучение с подкреплениемАктор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.
DQN85%
Deep Q-Network · Обучение с подкреплениемQ-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.
PPO85%
PPO · Обучение с подкреплениемУстойчивый policy-gradient метод с ограничением величины обновления политики.