Оптимизация обучения

Weight Decay

Затухание весов

актуальноТекущий рабочий стандарт

Постепенное сжатие весов к нулю на каждом шаге оптимизации.

Ключевые тезисы

  • Эквивалентно L2-регуляризации в классическом SGD.
  • В адаптивных методах требует отдельной реализации — см. AdamW.
  • Обычно не применяется к bias и параметрам нормализации.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Механика и отличие от L2

Одно и то же в SGD и разные вещи в Adam.

Обозначения
  • скорость обучения — длина шага оптимизатора
  • сила регуляризации: штраф за сложность модели
  • веса модели — то, что подбирается при обучении
Каждый шаг веса умножаются на число чуть меньше единицы

В чистом SGD это в точности эквивалентно добавлению к функции потерь. В адаптивных методах эквивалентность ломается — поэтому и существует AdamW.

  • Типичные значения: для свёрточных сетей, для трансформеров.
  • Не применяется к bias, embedding-таблицам и параметрам нормализации.
2

Подбор коэффициента

Как понять, что decay слишком велик или мал.

СимптомВероятная причина
train и val ошибки обе высокиdecay слишком велик — модель зажата
большой разрыв train/valdecay мал — нужна регуляризация
нормы весов растут без остановкиdecay отсутствует или обнулён по ошибке
На практике

Полезно логировать среднюю норму весов по слоям: она должна выходить на плато. Растущая норма при стабильных потерях — признак, что регуляризация не работает.

Связанные темы

Переобучение и регуляризация