Обучение с подкреплением

Policy Gradient

Градиент политики

актуальноТекущий рабочий стандарт

Прямая оптимизация параметров политики по градиенту ожидаемой награды.

Ключевые тезисы

  • Работает с непрерывными действиями, где max по Q невычислим.
  • REINFORCE — базовый вариант с высокой дисперсией.
  • Baseline и нормализация отдачи заметно стабилизируют обучение.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Теорема о градиенте политики

Как дифференцировать ожидаемую награду по параметрам политики.

Обозначения
  • математическое ожидание — среднее по распределению
  • параметры модели
  • состояние среды и выбранное в нём действие
  • градиент: вектор частных производных
  • логарифм: превращает произведения в суммы и сжимает масштаб
  • политика — правило выбора действия в состоянии

Интуиция: увеличиваем вероятность действий, приведших к большой награде, и уменьшаем для остальных. REINFORCE подставляет вместо фактический возврат эпизода — это несмещённая, но очень шумная оценка.

  • Baseline: вычитание не меняет матожидание градиента, но резко снижает дисперсию.
  • Нормализация возвратов внутри батча — простой и эффективный практический приём.
  • Policy gradient естественно работает с непрерывными действиями, где невычислим.
2

Борьба с дисперсией

Почему REINFORCE редко используют в чистом виде.

  • Baseline: вычитаем — матожидание градиента не меняется, дисперсия падает в разы.
  • GAE: сглаженная оценка преимущества с параметром , компромисс смещения и дисперсии.
  • Нормализация возвратов внутри батча — простая эвристика, которая почти всегда помогает.
  • Больше параллельных сред: усреднение по независимым траекториям снижает шум оценки.

Связанные темы

Основы обучения с подкреплением

MDP85%

Марковский процесс принятия решений · Обучение с подкреплением

Формальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.

States / Actions / Rewards85%

Состояния, действия, награды · Обучение с подкреплением

Три базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.

Value Functions85%

Функции ценности · Обучение с подкреплением

V(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.

Q-Learning85%

Q-обучение · Обучение с подкреплением

Off-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.

SARSA85%

SARSA · Обучение с подкреплением

On-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.

Actor-Critic85%

Актор-критик · Обучение с подкреплением

Актор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.

DQN85%

Deep Q-Network · Обучение с подкреплением

Q-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.

PPO85%

PPO · Обучение с подкреплением

Устойчивый policy-gradient метод с ограничением величины обновления политики.