Что разбирают и где
Тайм-коды записи, разобранные по темам атласа: под главой стоят темы, которые в ней названы, — из лекции можно уйти в текстовый разбор и вернуться.
Нажатие на тайм-код перематывает запись, не перезагружая страницу. Открыть на YouTube ↗
- Q-Learning
- Value FunctionsPolicy Gradient
- Value FunctionsTemporal Difference Learning
- Experience Replay
- On-policy and Off-policy
- Policy Gradient
- Value Functions
- Gradient
- Value FunctionsMSE
- MLP
- Gradient
- MLPDQN
- Policy Gradient
- DQN
- Experience Replay
- On-policy and Off-policy
- DQN
- DQN
- Model-Based RLDQN
- MDPStacking and Blending
- MLPDQN
- Normalization LayersRegularizationDQN
- DQN
- DQN
- DQN
- Advantage Function
- DQNAdvantage Function
- Normalization & StandardizationAdvantage Function
- Exploration in RL
- DQN
- On-policy and Off-policy
- Experience Replay
- On-policy and Off-policy
- DQN
- DQN
- MDP
- RNNMDP
- Backpropagation
- Experience Replay
- Scaling
- Experience Replay
- DQN
- Image preprocessing
- Q-Learning
- Reward Design
- Reward Design
- Q-LearningMLP
- Policy Gradient
- MSE
- Hyperparameter tuning