Видеокурс

Обучение с подкреплением

Reinforcement Learning

От марковских процессов до выравнивания языковых моделей

11 записей · 33 ч · 482 тайм-кода

Записи

  1. Введение в Reinforcement LearningЛекция3 ч 19 мин · 39 глав · 10.01.2026MDP
  2. Model-Free Reinforcement LearningЛекция2 ч 52 мин · 30 глав · 17.01.2026Model-Based RL · MDP
  3. Deep Q-Networks (DQN)Лекция3 ч 6 мин · 75 глав · 24.01.2026DQN
  4. Policy-based методы (Policy Gradient)Лекция3 ч 11 мин · 67 глав · 31.01.2026Policy Gradient
  5. Trust Region и Proximal Policy OptimizationЛекция3 ч 21 мин · 43 главы · 07.02.2026PPO · Optimization
  6. Непрерывное управление (Continuous Control)Лекция2 ч 43 мин · 30 глав · 14.02.2026
  7. Offline Reinforcement LearningЛекция2 ч 50 мин · 30 глав · 21.02.2026Offline RL
  8. Алгоритмы бандитовЛекция3 ч 16 мин · 44 главы · 28.02.2026Multi-armed Bandits
  9. Планирование и World ModelsЛекция2 ч 57 мин · 60 глав · 07.03.2026Planning and World Models
  10. Выравнивание языковых моделейЛекция2 ч 16 мин · 33 главы · 14.03.2026
  11. Обучение LLM-агентов и RLЛекция3 ч 20 мин · 31 глава · 21.03.2026

Темы атласа в этом курсе

Список собран из тайм-кодов: рядом с темой — во скольких главах записей она названа. Ссылка ведёт в разбор, а оттуда — обратно на нужную секунду.

Откуда запись

Курс выложен на YouTube плейлистом — атлас показывает его разметку и открывает записи с нужной секунды, само видео остаётся у авторов.

Плейлист на YouTube ↗