Глубокое обучение

Optimizers

Оптимизаторы

актуальноТекущий рабочий стандарт

Правила обновления весов по градиенту: от чистого SGD до адаптивных методов.

Ключевые тезисы

  • Momentum сглаживает траекторию и ускоряет движение по узким оврагам.
  • Adam адаптирует шаг по каждому параметру, AdamW корректно отделяет weight decay.
  • SGD с momentum часто даёт лучшую обобщающую способность в задачах зрения.
Тема также относится к главам:Оптимизация обученияМетоды

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Семейство методов

От SGD до Adam: что добавляет каждый шаг эволюции.

Обозначения
  • скорость обучения — длина шага оптимизатора
  • коэффициент сглаживания (инерции)
  • веса модели — то, что подбирается при обучении
Обозначения
  • скорость обучения — длина шага оптимизатора
  • коэффициент сглаживания (инерции)
  • малая константа для численной устойчивости
  • скользящие средние градиента и его квадрата в адаптивных оптимизаторах
  • веса модели — то, что подбирается при обучении
методSGD
шагов сделано30
f(x, y)0.2153
‖(x, y)‖0.656
Оптимизатор
Один овраг, три метода: SGD зигзагует поперёк, momentum разгоняется вдоль дна, Adam выравнивает шаги по осям
2

Что выбирать на практике

Готовые рецепты для типовых задач.

  • Трансформеры и LLM — AdamW, warmup + cosine decay, weight decay 0.01–0.1.
  • Компьютерное зрение (свёртки) — SGD с momentum 0.9 часто даёт лучшую обобщающую способность.
  • Быстрый прототип — Adam с lr : почти всегда «просто работает».
  • Табличные нейросети — AdamW плюс сильная регуляризация; часто проще взять бустинг.
На практике

Если обучение расходится в первые сотни шагов, первым делом уменьшайте learning rate и добавляйте warmup — это лечит больше проблем, чем смена архитектуры.

Связанные темы

Нейросеть по кирпичикам · Оптимизаторы

Optimization85%

Оптимизация · Основы

Поиск параметров, минимизирующих функцию потерь. Свойства задачи — выпуклость, гладкость, обусловленность — определяют, насколько это просто.

Gradient Descent85%

Градиентный спуск · Оптимизация обучения

Итеративный шаг против градиента функции потерь — базовый алгоритм обучения.

SGD85%

Стохастический градиентный спуск · Оптимизация обучения

Градиент оценивается по мини-батчу: быстрее, шумнее и, как оказалось, полезнее для обобщения.

Momentum85%

Момент · Оптимизация обучения

Накопление экспоненциального среднего градиентов — движение по инерции сквозь колебания.

Adam85%

Adam · Оптимизация обучения

Адаптивный метод: хранит средние градиента и его квадрата, подбирая шаг для каждого параметра.

AdamW85%

AdamW · Оптимизация обучения

Adam с корректно отделённым weight decay — регуляризация применяется к весам, а не к градиенту.

RMSProp85%

RMSProp · Оптимизация обучения

Нормирует шаг на скользящее среднее квадратов градиента, выравнивая масштаб обновлений.

Learning Rate Scheduling85%

Расписание скорости обучения · Оптимизация обучения

Изменение шага по ходу обучения: большой в начале для исследования, малый в конце для точной настройки.

Batch size85%

Размер батча · Оптимизация обучения

Число объектов на одно обновление весов: влияет на скорость, память и качество обобщения.

Perceptron80%

Перцептрон · Глубокое обучение

Простейший нейрон: взвешенная сумма входов и пороговая функция. Исторический старт всей области.

MLP80%

Многослойный перцептрон · Глубокое обучение

Несколько полносвязных слоёв с нелинейностями — универсальный аппроксиматор функций.

Activation functions80%

Функции активации · Глубокое обучение

Нелинейности между слоями, без которых сеть не сложнее линейной модели.

Loss functions80%

Функции потерь · Глубокое обучение

Формализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.

Backpropagation80%

Обратное распространение ошибки · Глубокое обучение

Эффективное вычисление градиентов по всем параметрам сети за один обратный проход с помощью правила цепочки.

Logistic Regression80%

Логистическая регрессия · Классическое машинное обучение

Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.