Обучение с подкреплением

PPO

PPO

актуальноТекущий рабочий стандарт

Устойчивый policy-gradient метод с ограничением величины обновления политики.

Что означает каждый компонент
  • обычный policy gradient: отношение вероятностей новой и старой политики, умноженное на преимущество
  • обрезка: если политика меняется слишком сильно, градиент обнуляется — отсюда устойчивость PPO

Ключевые тезисы

  • Clipped surrogate objective не даёт политике уйти слишком далеко за шаг.
  • Хороший баланс простоты, стабильности и качества — де-факто стандарт.
  • Используется в RLHF для дообучения языковых моделей.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Clipped objective

Как не дать политике измениться слишком сильно за один шаг.

Обозначения
  • математическое ожидание — среднее по распределению
  • параметры модели
  • малая величина: шум, допуск или защита от деления на ноль
  • награда, полученная агентом на шаге
  • матрица преобразования
  • функция потерь — то, что минимизируется при обучении
  • политика — правило выбора действия в состоянии

Если новая политика слишком сильно отклоняется от старой, отношение вероятностей обрезается и градиент обнуляется. Это даёт устойчивость TRPO без его сложной оптимизации со вторым порядком.

На практике

В RLHF PPO используется с дополнительным KL-штрафом относительно исходной модели: он не даёт языковой модели уйти слишком далеко и потерять языковые способности ради максимизации награды.

2

Практические детали PPO

Что настраивать и на что смотреть.

  • ; несколько эпох (3–10) по одному собранному батчу.
  • Обязательны: нормализация наблюдений и преимуществ, клиппинг градиента.
  • Следите за KL между старой и новой политикой: резкий рост означает, что шаг слишком велик.
  • Энтропийный бонус в функции потерь предотвращает преждевременную детерминированность.
На практике

В RLHF ту же схему применяют к языковой модели: «действие» — это выбранный токен, а KL-штраф относительно исходной модели не даёт ей деградировать ради награды.

Связанные темы

Адаптация языковых моделей · Основы обучения с подкреплением

MDP85%

Марковский процесс принятия решений · Обучение с подкреплением

Формальная рамка RL: состояния, действия, переходы, награды и коэффициент дисконтирования.

States / Actions / Rewards85%

Состояния, действия, награды · Обучение с подкреплением

Три базовых элемента задачи. Дизайн награды определяет поведение агента сильнее алгоритма.

Value Functions85%

Функции ценности · Обучение с подкреплением

V(s) оценивает ожидаемую отдачу из состояния, Q(s,a) — из пары состояние–действие.

Q-Learning85%

Q-обучение · Обучение с подкреплением

Off-policy метод: агент учит оптимальную Q-функцию независимо от того, как исследует среду.

SARSA85%

SARSA · Обучение с подкреплением

On-policy аналог Q-обучения: обновление идёт по реально выбранному следующему действию.

Policy Gradient85%

Градиент политики · Обучение с подкреплением

Прямая оптимизация параметров политики по градиенту ожидаемой награды.

Actor-Critic85%

Актор-критик · Обучение с подкреплением

Актор выбирает действия, критик оценивает их ценность — гибрид двух семейств методов.

DQN85%

Deep Q-Network · Обучение с подкреплением

Q-обучение с нейросетевой аппроксимацией: сеть предсказывает Q-значения по пикселям экрана.

Prompting80%

Промптинг · Генеративный ИИ

Управление поведением модели через формулировку запроса, без изменения весов.

Fine-tuning80%

Дообучение · Генеративный ИИ

Адаптация предобученной модели под домен или формат на собственных данных.

LoRA80%

LoRA · Генеративный ИИ

Обучение низкоранговых добавок к весам вместо полного дообучения модели.

RLHF80%

RLHF · Генеративный ИИ

Дообучение по человеческим предпочтениям: модель награды + оптимизация политики.

RAG80%

RAG · Генеративный ИИ

Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.

GPT80%

GPT · Обработка естественного языка

Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.