Обучение с подкреплением

DQN

Deep Q-Network

классикаИсторическая веха; сегодня чаще PPO и SAC.

Q-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.

Ключевые тезисы

  • Replay buffer разрывает корреляцию последовательных переходов.
  • Target-сеть стабилизирует цель обучения.
  • Double DQN, Dueling и Rainbow исправляют переоценку и ускоряют сходимость.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Три приёма, которые сделали DQN работающим

Почему нельзя просто заменить таблицу на нейросеть.

  • Replay buffer: последовательные переходы сильно коррелированы; случайная выборка из буфера возвращает предположение о независимости данных.
  • Target network: цель считается отдельной «замороженной» копией сети, иначе цель движется вместе с моделью и обучение расходится.
  • Обрезка награды до выравнивает масштаб между разными играми.
УлучшениеЧто чинит
Double DQNпереоценку из-за максимума
Duelingраздельная оценка и
Prioritized replayчаще переигрывать поучительные переходы
Rainbowвсё вместе
2

Практика обучения DQN

Гиперпараметры и типичные симптомы.

ПараметрТипичное значениеСимптом при неверном
размер replay bufferмал — забывание, велик — устаревшие данные
частота обновления target1 000–10 000 шаговчасто — расходимость
learning rateвелик — скачки Q-значений
ε-затухание1.0 → 0.05 за шаговбыстро — застревание в локальной стратегии
На практике

Полезный диагностический признак: средние Q-значения должны расти плавно и выходить на плато. Экспоненциальный рост означает расходимость из-за переоценки.

Связанные темы

Основы обучения с подкреплением

MDP85%

Марковский процесс принятия решений · Обучение с подкреплением

Формальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.

States / Actions / Rewards85%

Состояния, действия, награды · Обучение с подкреплением

Три базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.

Value Functions85%

Функции ценности · Обучение с подкреплением

V(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.

Q-Learning85%

Q-обучение · Обучение с подкреплением

Off-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.

SARSA85%

SARSA · Обучение с подкреплением

On-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.

Policy Gradient85%

Градиент политики · Обучение с подкреплением

Прямая оптимизация параметров политики по градиенту ожидаемой награды.

Actor-Critic85%

Актор-критик · Обучение с подкреплением

Актор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.

PPO85%

PPO · Обучение с подкреплением

Устойчивый policy-gradient метод с ограничением величины обновления политики.