Любое ограничение сложности модели, снижающее переобучение.
Ключевые тезисы
- L1 обнуляет коэффициенты и отбирает признаки, L2 их равномерно сжимает.
- Dropout случайно отключает нейроны, имитируя ансамбль.
- Аугментация данных — самая мощная форма регуляризации.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1L1 и L2: геометрия штрафа
Почему один штраф обнуляет коэффициенты, а другой нет.
- сила регуляризации: штраф за сложность модели
- веса модели — то, что подбирается при обучении
- функция потерь — то, что минимизируется при обучении
- суммирование по всем перечисленным элементам
Ограничение задаёт ромб с углами на осях, а — круг. Линии уровня функции потерь чаще касаются ромба именно в углу, где часть координат равна нулю — отсюда разреженность решения Lasso.
2Dropout, аугментация и другие способы
Регуляризация — это не только штраф на веса.
- Dropout: во время обучения каждый нейрон отключается с вероятностью ; сеть вынуждена не полагаться на отдельные признаки. На инференсе выключается.
- Аугментация данных — самый сильный метод в CV и аудио: модель видит новые варианты одного и того же объекта.
- Label smoothing: вместо цели 1.0 используют 0.9 — модель перестаёт быть переуверенной.
- Early stopping — регуляризация по времени обучения.
- Ансамблирование — усреднение снижает разброс.
Порядок действий при переобучении: сначала больше данных и аугментаций, затем более простая модель, затем dropout / weight decay, и только потом тонкая настройка коэффициентов.
Связанные темы
Переобучение и регуляризация
Weight Decay80%
Затухание весов · Оптимизация обученияПостепенное сжатие весов к нулю на каждом шаге оптимизации.
Early Stopping80%
Ранняя остановка · Оптимизация обученияОбучение останавливается, когда валидационная метрика перестала улучшаться.
Overfitting80%
Переобучение · Практика MLМодель запомнила обучающую выборку вместе с шумом: train-метрика отличная, val — плохая.
Underfitting80%
Недообучение · Практика MLМодель слишком проста или недоучена: ошибка велика и на train, и на валидации.
Variance80%
Дисперсия · Математический справочникМера разброса значений вокруг среднего.
Random Forest80%
Случайный лес · Классическое машинное обучениеБэггинг деревьев со случайными подвыборками объектов и признаков: усреднение резко снижает дисперсию.