V(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.
Ключевые тезисы
- Уравнение Беллмана связывает ценность состояния с ценностью следующих.
- Функция преимущества A = Q − V снижает дисперсию в policy-методах.
- Оценки ценности лежат в основе всех value-based алгоритмов.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Уравнения Беллмана
Рекуррентная связь между ценностью состояния и ценностью следующих.
- математическое ожидание — среднее по распределению
- коэффициент дисконтирования: насколько важна отложенная награда
- состояние среды и выбранное в нём действие
- награда, полученная агентом на шаге
- политика — правило выбора действия в состоянии
- математическое ожидание — среднее по распределению
- коэффициент дисконтирования: насколько важна отложенная награда
- состояние среды и выбранное в нём действие
- награда, полученная агентом на шаге
Функция преимущества отвечает на вопрос «насколько это действие лучше среднего в данном состоянии». Она используется в actor-critic методах для снижения дисперсии градиента.
2TD-обучение против Монте-Карло
Обновляться на каждом шаге или ждать конца эпизода.
| Монте-Карло | TD(0) | |
|---|---|---|
| Когда обновляет | в конце эпизода | на каждом шаге |
| Смещение | нет | есть (бутстрэп) |
| Дисперсия | высокая | низкая |
| Непрерывные задачи | не работает | работает |
- коэффициент дисконтирования: насколько важна отложенная награда
- состояние среды и выбранное в нём действие
- награда, полученная агентом на шаге
- ожидаемая суммарная награда из состояния s
Связанные темы
Основы обучения с подкреплением
MDP85%
Марковский процесс принятия решений · Обучение с подкреплениемФормальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.
States / Actions / Rewards85%
Состояния, действия, награды · Обучение с подкреплениемТри базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.
Q-Learning85%
Q-обучение · Обучение с подкреплениемOff-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.
SARSA85%
SARSA · Обучение с подкреплениемOn-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.
Policy Gradient85%
Градиент политики · Обучение с подкреплениемПрямая оптимизация параметров политики по градиенту ожидаемой награды.
Actor-Critic85%
Актор-критик · Обучение с подкреплениемАктор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.
DQN85%
Deep Q-Network · Обучение с подкреплениемQ-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.
PPO85%
PPO · Обучение с подкреплениемУстойчивый policy-gradient метод с ограничением величины обновления политики.