Q-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.
Ключевые тезисы
- Replay buffer разрывает корреляцию последовательных переходов.
- Target-сеть стабилизирует цель обучения.
- Double DQN, Dueling и Rainbow исправляют переоценку и ускоряют сходимость.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Три приёма, которые сделали DQN работающим
Почему нельзя просто заменить таблицу на нейросеть.
- Replay buffer: последовательные переходы сильно коррелированы; случайная выборка из буфера возвращает предположение о независимости данных.
- Target network: цель считается отдельной «замороженной» копией сети, иначе цель движется вместе с моделью и обучение расходится.
- Обрезка награды до выравнивает масштаб между разными играми.
| Улучшение | Что чинит |
|---|---|
| Double DQN | переоценку из-за максимума |
| Dueling | раздельная оценка и |
| Prioritized replay | чаще переигрывать поучительные переходы |
| Rainbow | всё вместе |
2Практика обучения DQN
Гиперпараметры и типичные симптомы.
| Параметр | Типичное значение | Симптом при неверном |
|---|---|---|
| размер replay buffer | – | мал — забывание, велик — устаревшие данные |
| частота обновления target | 1 000–10 000 шагов | часто — расходимость |
| learning rate | велик — скачки Q-значений | |
| ε-затухание | 1.0 → 0.05 за шагов | быстро — застревание в локальной стратегии |
Полезный диагностический признак: средние Q-значения должны расти плавно и выходить на плато. Экспоненциальный рост означает расходимость из-за переоценки.
Связанные темы
Основы обучения с подкреплением
MDP85%
Марковский процесс принятия решений · Обучение с подкреплениемФормальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.
States / Actions / Rewards85%
Состояния, действия, награды · Обучение с подкреплениемТри базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.
Value Functions85%
Функции ценности · Обучение с подкреплениемV(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.
Q-Learning85%
Q-обучение · Обучение с подкреплениемOff-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.
SARSA85%
SARSA · Обучение с подкреплениемOn-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.
Policy Gradient85%
Градиент политики · Обучение с подкреплениемПрямая оптимизация параметров политики по градиенту ожидаемой награды.
Actor-Critic85%
Актор-критик · Обучение с подкреплениемАктор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.
PPO85%
PPO · Обучение с подкреплениемУстойчивый policy-gradient метод с ограничением величины обновления политики.