Обучение с подкреплением

Deep Q-Networks (DQN)

Лекция3 ч 6 мин · запись 24.01.2026

Что разбирают и где

Тайм-коды записи, разобранные по темам атласа: под главой стоят темы, которые в ней названы, — из лекции можно уйти в текстовый разбор и вернуться.

Нажатие на тайм-код перематывает запись, не перезагружая страницу. Открыть на YouTube ↗

  1. Q-Learning
  2. Value FunctionsPolicy Gradient
  3. Value FunctionsTemporal Difference Learning
  4. Experience Replay
  5. On-policy and Off-policy
  6. Policy Gradient
  7. Value Functions
  8. Gradient
  9. Value FunctionsMSE
  10. MLP
  11. Gradient
  12. MLPDQN
  13. Policy Gradient
  14. DQN
  15. Experience Replay
  16. On-policy and Off-policy
  17. DQN
  18. DQN
  19. Model-Based RLDQN
  20. MDPStacking and Blending
  21. MLPDQN
  22. Normalization LayersRegularizationDQN
  23. DQN
  24. DQN
  25. DQN
  26. Advantage Function
  27. DQNAdvantage Function
  28. Normalization & StandardizationAdvantage Function
  29. Exploration in RL
  30. DQN
  31. On-policy and Off-policy
  32. Experience Replay
  33. On-policy and Off-policy
  34. DQN
  35. DQN
  36. MDP
  37. RNNMDP
  38. Backpropagation
  39. Experience Replay
  40. Scaling
  41. Experience Replay
  42. DQN
  43. Image preprocessing
  44. Q-Learning
  45. Reward Design
  46. Reward Design
  47. Q-LearningMLP
  48. Policy Gradient
  49. MSE
  50. Hyperparameter tuning