Optimization
Оптимизация обучения
Алгоритмы обновления параметров, расписания скорости обучения и регуляризация — практическая механика обучения нейросетей.
Gradient Descentактуально
Градиентный спускИтеративный шаг против градиента функции потерь — базовый алгоритм обучения.
SGDактуально
Стохастический градиентный спускГрадиент оценивается по мини-батчу: быстрее, шумнее и, как оказалось, полезнее для обобщения.
Momentumактуально
МоментНакопление экспоненциального среднего градиентов — движение по инерции сквозь колебания.
Adamактуально
AdamАдаптивный метод: хранит средние градиента и его квадрата, подбирая шаг для каждого параметра.
AdamWактуально
AdamWAdam с корректно отделённым weight decay — регуляризация применяется к весам, а не к градиенту.
RMSPropклассика
RMSPropНормирует шаг на скользящее среднее квадратов градиента, выравнивая масштаб обновлений.
Optimizersактуально
Оптимизаторыиз «Глубокое обучение»Правила обновления весов по градиенту: от чистого SGD до адаптивных методов.
Convexityактуально
Выпуклостьиз «Математический анализ»Свойство функции, гарантирующее единственность минимума и сходимость градиентных методов.
Taylor Seriesактуально
Ряд Тейлораиз «Математический анализ»Приближение функции многочленом по производным в точке. Инструмент, которым обосновывают почти все методы оптимизации.
Hessianактуально
Гессианиз «Математический справочник»Матрица вторых производных, описывающая локальную кривизну функции.
Learning Rate Schedulingактуально
Расписание скорости обученияИзменение шага по ходу обучения: большой в начале для исследования, малый в конце для точной настройки.
Batch sizeактуально
Размер батчаЧисло объектов на одно обновление весов: влияет на скорость, память и качество обобщения.
Regularizationактуально
РегуляризацияЛюбое ограничение сложности модели, снижающее переобучение.
Weight Decayактуально
Затухание весовПостепенное сжатие весов к нулю на каждом шаге оптимизации.
Early Stoppingактуально
Ранняя остановкаОбучение останавливается, когда валидационная метрика перестала улучшаться.
Overfittingактуально
Переобучениеиз «Практика ML»Модель запомнила обучающую выборку вместе с шумом: train-метрика отличная, val — плохая.
Gradient Clippingактуально
Обрезка градиентаОграничение нормы градиента перед шагом оптимизатора — простейшая защита от расходимости обучения.
Mixed Precisionактуально
Смешанная точностьОбучение в fp16 или bf16 при накоплении в fp32: двукратная экономия памяти и заметное ускорение.
Normalization Layersактуально
Слои нормализациииз «Глубокое обучение»BatchNorm, LayerNorm, RMSNorm: стабилизация распределения активаций, без которой глубокие сети почти не обучаются.
6 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.