Оптимизация обучения

RMSProp

RMSProp

классикаПрактически полностью вытеснен Adam/AdamW.

Нормирует шаг на скользящее среднее квадратов градиента, выравнивая масштаб обновлений.

Ключевые тезисы

  • Хорошо ведёт себя на нестационарных задачах и рекуррентных сетях.
  • Предшественник Adam — фактически Adam без momentum.
  • Долго существовал только в виде слайда лекции Хинтона.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Нормировка на скользящее среднее квадратов

Предшественник Adam, который всё ещё полезен.

Обозначения
  • скорость обучения — длина шага оптимизатора
  • малая величина: шум, допуск или защита от деления на ноль
  • веса модели — то, что подбирается при обучении

В отличие от AdaGrad, где знаменатель монотонно растёт и обучение в итоге останавливается, RMSProp использует экспоненциальное среднее — метод остаётся работоспособным сколь угодно долго. Это делает его удобным для нестационарных задач: RNN, обучение с подкреплением.

2

AdaGrad и почему от него отказались

Монотонно растущий знаменатель убивает обучение.

Обозначения
  • скорость обучения — длина шага оптимизатора
  • малая величина: шум, допуск или защита от деления на ноль
  • веса модели — то, что подбирается при обучении

Сумма квадратов только растёт, поэтому эффективный шаг стремится к нулю и обучение останавливается ещё до сходимости. RMSProp заменяет сумму экспоненциальным средним и снимает проблему. AdaGrad при этом остаётся разумным выбором для очень разреженных признаков.

Связанные темы

Оптимизаторы

Optimization85%

Оптимизация · Основы

Поиск параметров, минимизирующих функцию потерь. Свойства задачи — выпуклость, гладкость, обусловленность — определяют, насколько это просто.

Optimizers85%

Оптимизаторы · Глубокое обучение

Правила обновления весов по градиенту: от чистого SGD до адаптивных методов.

Gradient Descent85%

Градиентный спуск · Оптимизация обучения

Итеративный шаг против градиента функции потерь — базовый алгоритм обучения.

SGD85%

Стохастический градиентный спуск · Оптимизация обучения

Градиент оценивается по мини-батчу: быстрее, шумнее и, как оказалось, полезнее для обобщения.

Momentum85%

Момент · Оптимизация обучения

Накопление экспоненциального среднего градиентов — движение по инерции сквозь колебания.

Adam85%

Adam · Оптимизация обучения

Адаптивный метод: хранит средние градиента и его квадрата, подбирая шаг для каждого параметра.

AdamW85%

AdamW · Оптимизация обучения

Adam с корректно отделённым weight decay — регуляризация применяется к весам, а не к градиенту.

Learning Rate Scheduling85%

Расписание скорости обучения · Оптимизация обучения

Изменение шага по ходу обучения: большой в начале для исследования, малый в конце для точной настройки.

Batch size85%

Размер батча · Оптимизация обучения

Число объектов на одно обновление весов: влияет на скорость, память и качество обобщения.