Что разбирают и где
Тайм-коды записи, разобранные по темам атласа: под главой стоят темы, которые в ней названы, — из лекции можно уйти в текстовый разбор и вернуться.
Нажатие на тайм-код перематывает запись, не перезагружая страницу. Открыть на YouTube ↗
- Policy Gradient
- Policy GradientActor-Critic
- Advantage FunctionVariance
- Advantage Function
- Advantage Function
- On-policy and Off-policyActor-Critic
- On-policy and Off-policy
- Value FunctionsActor-Critic
- Advantage Function
- Advantage Function
- Advantage Function
- Advantage FunctionVariance
- Actor-Critic
- Reward Design
- Advantage FunctionPolicy Gradient
- On-policy and Off-policy
- On-policy and Off-policy
- KL Divergence
- PPOOptimization
- PPO
- Policy GradientGradient
- GradientPPO
- PPO
- Model-Based RLPPOActor-Critic
- PPO
- Optimization
- PPO
- Advantage FunctionPPO
- PPO
- PPO
- PPO
- PPO
- Actor-CriticPPO
- ScalingReward Design
- PPO
- PPO