Reinforcement Learning
Обучение с подкреплением
Агент действует в среде, получает награду и учится стратегии, максимизирующей суммарный выигрыш. Отсюда же растёт RLHF в языковых моделях.
MDPактуально
Марковский процесс принятия решенийФормальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.
States / Actions / Rewardsактуально
Состояния, действия, наградыТри базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.
Value Functionsактуально
Функции ценностиV(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.
Markov Chainsактуально
Марковские цепииз «Теория вероятностей и распределения»Процесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.
Q-Learningактуально
Q-обучениеOff-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.
SARSAклассика
SARSAOn-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.
DQNклассика
Deep Q-NetworkQ-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.
Policy Gradientактуально
Градиент политикиПрямая оптимизация параметров политики по градиенту ожидаемой награды.
Actor-Criticактуально
Актор-критикАктор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.
PPOактуально
PPOУстойчивый policy-gradient метод с ограничением величины обновления политики.
RLHFновинка
RLHFиз «Генеративный ИИ»Дообучение по человеческим предпочтениям: модель награды + оптимизация политики.
Offline RLновинка
Оффлайн RLОбучение политики по логам прошлых взаимодействий, без возможности экспериментировать со средой.
Multi-armed Banditsактуально
Многорукие бандитыУпрощённый RL без состояний: выбираем действие, получаем награду и балансируем исследование с эксплуатацией.
Beta Distributionактуально
Бета-распределениеиз «Теория вероятностей и распределения»Распределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.
3 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.