Прямая оптимизация параметров политики по градиенту ожидаемой награды.
Ключевые тезисы
- Работает с непрерывными действиями, где max по Q невычислим.
- REINFORCE — базовый вариант с высокой дисперсией.
- Baseline и нормализация отдачи заметно стабилизируют обучение.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Теорема о градиенте политики
Как дифференцировать ожидаемую награду по параметрам политики.
- математическое ожидание — среднее по распределению
- параметры модели
- состояние среды и выбранное в нём действие
- градиент: вектор частных производных
- логарифм: превращает произведения в суммы и сжимает масштаб
- политика — правило выбора действия в состоянии
Интуиция: увеличиваем вероятность действий, приведших к большой награде, и уменьшаем для остальных. REINFORCE подставляет вместо фактический возврат эпизода — это несмещённая, но очень шумная оценка.
- Baseline: вычитание не меняет матожидание градиента, но резко снижает дисперсию.
- Нормализация возвратов внутри батча — простой и эффективный практический приём.
- Policy gradient естественно работает с непрерывными действиями, где невычислим.
2Борьба с дисперсией
Почему REINFORCE редко используют в чистом виде.
- Baseline: вычитаем — матожидание градиента не меняется, дисперсия падает в разы.
- GAE: сглаженная оценка преимущества с параметром , компромисс смещения и дисперсии.
- Нормализация возвратов внутри батча — простая эвристика, которая почти всегда помогает.
- Больше параллельных сред: усреднение по независимым траекториям снижает шум оценки.
Связанные темы
Основы обучения с подкреплением
MDP85%
Марковский процесс принятия решений · Обучение с подкреплениемФормальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.
States / Actions / Rewards85%
Состояния, действия, награды · Обучение с подкреплениемТри базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.
Value Functions85%
Функции ценности · Обучение с подкреплениемV(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.
Q-Learning85%
Q-обучение · Обучение с подкреплениемOff-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.
SARSA85%
SARSA · Обучение с подкреплениемOn-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.
Actor-Critic85%
Актор-критик · Обучение с подкреплениемАктор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.
DQN85%
Deep Q-Network · Обучение с подкреплениемQ-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.
PPO85%
PPO · Обучение с подкреплениемУстойчивый policy-gradient метод с ограничением величины обновления политики.