Обучение с подкреплением

Выравнивание языковых моделей

Лекция2 ч 16 мин · запись 14.03.2026

Что разбирают и где

Тайм-коды записи, разобранные по темам атласа: под главой стоят темы, которые в ней названы, — из лекции можно уйти в текстовый разбор и вернуться.

Нажатие на тайм-код перематывает запись, не перезагружая страницу. Открыть на YouTube ↗

  1. LLM
  2. LLM
  3. AttentionTransformers
  4. ML Pipelines
  5. Fine-tuning
  6. LLM
  7. Policy GradientLLM
  8. LoRA
  9. RLHF
  10. RLHFPPO
  11. PPO
  12. ML Pipelines
  13. PPO
  14. Optimization
  15. MDP
  16. Prompting
  17. Distillation
  18. Entropy