Нормирует шаг на скользящее среднее квадратов градиента, выравнивая масштаб обновлений.
Ключевые тезисы
- Хорошо ведёт себя на нестационарных задачах и рекуррентных сетях.
- Предшественник Adam — фактически Adam без momentum.
- Долго существовал только в виде слайда лекции Хинтона.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Нормировка на скользящее среднее квадратов
Предшественник Adam, который всё ещё полезен.
- скорость обучения — длина шага оптимизатора
- малая величина: шум, допуск или защита от деления на ноль
- веса модели — то, что подбирается при обучении
В отличие от AdaGrad, где знаменатель монотонно растёт и обучение в итоге останавливается, RMSProp использует экспоненциальное среднее — метод остаётся работоспособным сколь угодно долго. Это делает его удобным для нестационарных задач: RNN, обучение с подкреплением.
2AdaGrad и почему от него отказались
Монотонно растущий знаменатель убивает обучение.
- скорость обучения — длина шага оптимизатора
- малая величина: шум, допуск или защита от деления на ноль
- веса модели — то, что подбирается при обучении
Сумма квадратов только растёт, поэтому эффективный шаг стремится к нулю и обучение останавливается ещё до сходимости. RMSProp заменяет сумму экспоненциальным средним и снимает проблему. AdaGrad при этом остаётся разумным выбором для очень разреженных признаков.
Связанные темы
Оптимизаторы
Optimization85%
Оптимизация · ОсновыПоиск параметров, минимизирующих функцию потерь. Свойства задачи — выпуклость, гладкость, обусловленность — определяют, насколько это просто.
Optimizers85%
Оптимизаторы · Глубокое обучениеПравила обновления весов по градиенту: от чистого SGD до адаптивных методов.
Gradient Descent85%
Градиентный спуск · Оптимизация обученияИтеративный шаг против градиента функции потерь — базовый алгоритм обучения.
SGD85%
Стохастический градиентный спуск · Оптимизация обученияГрадиент оценивается по мини-батчу: быстрее, шумнее и, как оказалось, полезнее для обобщения.
Momentum85%
Момент · Оптимизация обученияНакопление экспоненциального среднего градиентов — движение по инерции сквозь колебания.
Adam85%
Adam · Оптимизация обученияАдаптивный метод: хранит средние градиента и его квадрата, подбирая шаг для каждого параметра.
AdamW85%
AdamW · Оптимизация обученияAdam с корректно отделённым weight decay — регуляризация применяется к весам, а не к градиенту.
Learning Rate Scheduling85%
Расписание скорости обучения · Оптимизация обученияИзменение шага по ходу обучения: большой в начале для исследования, малый в конце для точной настройки.
Batch size85%
Размер батча · Оптимизация обученияЧисло объектов на одно обновление весов: влияет на скорость, память и качество обобщения.