Раздел 14

Optimization

Оптимизация обучения

Алгоритмы обновления параметров, расписания скорости обучения и регуляризация — практическая механика обучения нейросетей.

новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

Gradient Descentактуально

Градиентный спуск

Итеративный шаг против градиента функции потерь — базовый алгоритм обучения.

SGDактуально

Стохастический градиентный спуск

Градиент оценивается по мини-батчу: быстрее, шумнее и, как оказалось, полезнее для обобщения.

Momentumактуально

Момент

Накопление экспоненциального среднего градиентов — движение по инерции сквозь колебания.

Adamактуально

Adam

Адаптивный метод: хранит средние градиента и его квадрата, подбирая шаг для каждого параметра.

AdamWактуально

AdamW

Adam с корректно отделённым weight decay — регуляризация применяется к весам, а не к градиенту.

RMSPropклассика

RMSProp

Нормирует шаг на скользящее среднее квадратов градиента, выравнивая масштаб обновлений.

Optimizersактуально

Оптимизаторыиз «Глубокое обучение»

Правила обновления весов по градиенту: от чистого SGD до адаптивных методов.

Convexityактуально

Выпуклостьиз «Математический анализ»

Свойство функции, гарантирующее единственность минимума и сходимость градиентных методов.

Taylor Seriesактуально

Ряд Тейлораиз «Математический анализ»

Приближение функции многочленом по производным в точке. Инструмент, которым обосновывают почти все методы оптимизации.

Hessianактуально

Гессианиз «Математический справочник»

Матрица вторых производных, описывающая локальную кривизну функции.

Learning Rate Schedulingактуально

Расписание скорости обучения

Изменение шага по ходу обучения: большой в начале для исследования, малый в конце для точной настройки.

Batch sizeактуально

Размер батча

Число объектов на одно обновление весов: влияет на скорость, память и качество обобщения.

Regularizationактуально

Регуляризация

Любое ограничение сложности модели, снижающее переобучение.

Weight Decayактуально

Затухание весов

Постепенное сжатие весов к нулю на каждом шаге оптимизации.

Early Stoppingактуально

Ранняя остановка

Обучение останавливается, когда валидационная метрика перестала улучшаться.

Overfittingактуально

Переобучениеиз «Практика ML»

Модель запомнила обучающую выборку вместе с шумом: train-метрика отличная, val — плохая.

Gradient Clippingактуально

Обрезка градиента

Ограничение нормы градиента перед шагом оптимизатора — простейшая защита от расходимости обучения.

Mixed Precisionактуально

Смешанная точность

Обучение в fp16 или bf16 при накоплении в fp32: двукратная экономия памяти и заметное ускорение.

Normalization Layersактуально

Слои нормализациииз «Глубокое обучение»

BatchNorm, LayerNorm, RMSNorm: стабилизация распределения активаций, без которой глубокие сети почти не обучаются.

6 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.