Обучение с подкреплением

Model-Free Reinforcement Learning

Лекция2 ч 52 мин · запись 17.01.2026

Что разбирают и где

Тайм-коды записи, разобранные по темам атласа: под главой стоят темы, которые в ней названы, — из лекции можно уйти в текстовый разбор и вернуться.

Нажатие на тайм-код перематывает запись, не перезагружая страницу. Открыть на YouTube ↗

  1. MDP
  2. MDP
  3. Model-Based RL
  4. Model-Based RL
  5. Value Functions
  6. Gradient
  7. Temporal Difference Learning
  8. Exploration in RL
  9. Policy Gradient
  10. Exploration in RL
  11. On-policy and Off-policy
  12. Q-LearningOn-policy and Off-policy
  13. On-policy and Off-policySARSA
  14. Q-LearningSARSA
  15. Experience ReplayOn-policy and Off-policy
  16. Q-LearningModel-Based RLExploration in RL
  17. Model-Based RL
  18. SARSA
  19. Q-Learning
  20. SARSA
  21. Q-Learning
  22. SARSA