Обучение с подкреплением

Обучение LLM-агентов и RL

Лекция3 ч 20 мин · запись 21.03.2026

Что разбирают и где

Тайм-коды записи, разобранные по темам атласа: под главой стоят темы, которые в ней названы, — из лекции можно уйти в текстовый разбор и вернуться.

Нажатие на тайм-код перематывает запись, не перезагружая страницу. Открыть на YouTube ↗

  1. Agents
  2. RLHF
  3. RLHF
  4. RLHF
  5. MDP
  6. LLM
  7. Planning and World ModelsAgents
  8. Agents
  9. On-policy and Off-policy
  10. Reward DesignAgents
  11. Agents
  12. Tokenization
  13. Advantage FunctionAgents
  14. Optimization
  15. Multi-armed Bandits
  16. Multi-armed Bandits
  17. Reward Design