Записи
- Введение в Reinforcement LearningЛекцияMDP
- Model-Free Reinforcement LearningЛекцияModel-Based RL · MDP
- Deep Q-Networks (DQN)ЛекцияDQN
- Policy-based методы (Policy Gradient)ЛекцияPolicy Gradient
- Trust Region и Proximal Policy OptimizationЛекцияPPO · Optimization
- Непрерывное управление (Continuous Control)Лекция
- Offline Reinforcement LearningЛекцияOffline RL
- Алгоритмы бандитовЛекцияMulti-armed Bandits
- Планирование и World ModelsЛекцияPlanning and World Models
- Выравнивание языковых моделейЛекция
- Обучение LLM-агентов и RLЛекция
Темы атласа в этом курсе
Список собран из тайм-кодов: рядом с темой — во скольких главах записей она названа. Ссылка ведёт в разбор, а оттуда — обратно на нужную секунду.
Policy Gradient36Actor-Critic24DQN23Value Functions22Planning and World Models22Advantage Function21Multi-armed Bandits20PPO20MDP17Reward Design17On-policy and Off-policy16Model-Based RL14Offline RL11Q-Learning11Gradient10Exploration in RL10Agents7Experience Replay7MLP6SARSA6Optimization5LLM5RLHF5Backpropagation4Variance4Entropy3MSE3Scaling3Discounting and Horizon3Dynamic Programming2Stacking and Blending2Image preprocessing2Loss functions2LSTM2RNN2Transformers2Cross-Entropy2KL Divergence2ML Pipelines2Regularization2
Откуда запись
Курс выложен на YouTube плейлистом — атлас показывает его разметку и открывает записи с нужной секунды, само видео остаётся у авторов.