Раздел 09

Reinforcement Learning

Обучение с подкреплением

Агент действует в среде, получает награду и учится стратегии, максимизирующей суммарный выигрыш. Отсюда же растёт RLHF в языковых моделях.

1 новинок8 актуальных2 классикаDS-направление
новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

MDPактуально

Марковский процесс принятия решений

Формальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.

States / Actions / Rewardsактуально

Состояния, действия, награды

Три базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.

Value Functionsактуально

Функции ценности

V(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.

Markov Chainsактуально

Марковские цепииз «Теория вероятностей и распределения»

Процесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.

Q-Learningактуально

Q-обучение

Off-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.

SARSAклассика

SARSA

On-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.

DQNклассика

Deep Q-Network

Q-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.

Policy Gradientактуально

Градиент политики

Прямая оптимизация параметров политики по градиенту ожидаемой награды.

Actor-Criticактуально

Актор-критик

Актор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.

PPOактуально

PPO

Устойчивый policy-gradient метод с ограничением величины обновления политики.

RLHFновинка

RLHFиз «Генеративный ИИ»

Дообучение по человеческим предпочтениям: модель награды + оптимизация политики.

Offline RLновинка

Оффлайн RL

Обучение политики по логам прошлых взаимодействий, без возможности экспериментировать со средой.

Multi-armed Banditsактуально

Многорукие бандиты

Упрощённый RL без состояний: выбираем действие, получаем награду и балансируем исследование с эксплуатацией.

Beta Distributionактуально

Бета-распределениеиз «Теория вероятностей и распределения»

Распределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.

3 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.