Обучение с подкреплением

Непрерывное управление (Continuous Control)

Лекция2 ч 43 мин · запись 14.02.2026

Что разбирают и где

Тайм-коды записи, разобранные по темам атласа: под главой стоят темы, которые в ней названы, — из лекции можно уйти в текстовый разбор и вернуться.

Нажатие на тайм-код перематывает запись, не перезагружая страницу. Открыть на YouTube ↗

  1. Policy GradientDQN
  2. Reward Design
  3. On-policy and Off-policy
  4. Policy GradientDQN
  5. Policy Gradient
  6. Exploration in RL
  7. Actor-Critic
  8. DQNActor-Critic
  9. Actor-Critic
  10. Policy Gradient
  11. Exploration in RL
  12. MDP
  13. Actor-CriticValue Functions
  14. Actor-CriticAdvantage Function
  15. Actor-Critic
  16. Loss functions
  17. Scaling
  18. Actor-Critic