Обучение с подкреплением

Trust Region и Proximal Policy Optimization

Лекция3 ч 21 мин · запись 07.02.2026

Что разбирают и где

Тайм-коды записи, разобранные по темам атласа: под главой стоят темы, которые в ней названы, — из лекции можно уйти в текстовый разбор и вернуться.

Нажатие на тайм-код перематывает запись, не перезагружая страницу. Открыть на YouTube ↗

  1. Policy Gradient
  2. Policy GradientActor-Critic
  3. Advantage FunctionVariance
  4. Advantage Function
  5. Advantage Function
  6. On-policy and Off-policyActor-Critic
  7. On-policy and Off-policy
  8. Value FunctionsActor-Critic
  9. Advantage Function
  10. Advantage Function
  11. Advantage Function
  12. Advantage FunctionVariance
  13. Actor-Critic
  14. Reward Design
  15. Advantage FunctionPolicy Gradient
  16. On-policy and Off-policy
  17. On-policy and Off-policy
  18. KL Divergence
  19. PPOOptimization
  20. PPO
  21. Policy GradientGradient
  22. GradientPPO
  23. PPO
  24. Model-Based RLPPOActor-Critic
  25. PPO
  26. Optimization
  27. PPO
  28. Advantage FunctionPPO
  29. PPO
  30. PPO
  31. PPO
  32. PPO
  33. Actor-CriticPPO
  34. ScalingReward Design
  35. PPO
  36. PPO