Обучение с подкреплением

Policy-based методы (Policy Gradient)

Лекция3 ч 11 мин · запись 31.01.2026

Что разбирают и где

Тайм-коды записи, разобранные по темам атласа: под главой стоят темы, которые в ней названы, — из лекции можно уйти в текстовый разбор и вернуться.

Нажатие на тайм-код перематывает запись, не перезагружая страницу. Открыть на YouTube ↗

  1. Policy Gradient
  2. DQN
  3. Exploration in RLPolicy Gradient
  4. Value Functions
  5. DQN
  6. Policy Gradient
  7. MLPPolicy Gradient
  8. Policy Gradient
  9. Policy Gradient
  10. Reward Design
  11. Policy GradientGradient
  12. GradientPolicy Gradient
  13. Policy Gradient
  14. Policy Gradient
  15. Discounting and HorizonGradient
  16. Policy GradientAdvantage Function
  17. GradientVariance
  18. BaselinesVariance
  19. Baselines
  20. Reward DesignAdvantage Function
  21. Advantage Function
  22. Exploration in RL
  23. Reward Design
  24. Advantage Function
  25. Actor-Critic
  26. Actor-CriticAdvantage Function
  27. Advantage Function
  28. RNN
  29. Actor-CriticEntropy
  30. Actor-Critic
  31. SARSAActor-CriticDQN
  32. Reward Design
  33. Policy Gradient
  34. EntropyPolicy Gradient
  35. Policy Gradient
  36. Image preprocessing
  37. LSTM
  38. LSTM
  39. Actor-Critic
  40. Testing ML Code
  41. Gradient
  42. Advantage Function
  43. Actor-CriticMSE
  44. Actor-Critic
  45. PPO