Мера разброса значений вокруг среднего.
- систематическая ошибка: модель слишком проста для данных (лечится усложнением и бустингом)
- разброс: модель слишком чувствительна к конкретной выборке (лечится данными, регуляризацией, бэггингом)
- неустранимый шум данных — предел, ниже которого не опустится никакая модель
Ключевые тезисы
- Var[X] = E[X²] − (E[X])².
- Разложение ошибки на bias и variance — центральная идея ML.
- Ансамблирование снижает именно дисперсию.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Разложение ошибки
Bias–variance как прямое следствие определений.
- математическое ожидание — среднее по распределению
- дисперсия — мера разброса значений
- стандартное отклонение — разброс величины
- истинное значение целевой переменной
- вектор или точка пространства признаков
- функция, о которой идёт речь
- Bias — систематическая ошибка: модель слишком проста для данных.
- Variance — чувствительность к конкретной обучающей выборке.
- $\sigma^2$ — неустранимый шум; ниже него не опустится никакая модель.
2Почему ансамбли работают
Арифметика снижения дисперсии.
- дисперсия — мера разброса значений
- стандартное отклонение — разброс величины
- суммирование по всем перечисленным элементам
При дисперсия падает в раз; при не падает вовсе. Отсюда весь дизайн ансамблей: бутстрэп, случайные подмножества признаков, разные архитектуры и сиды — всё это способы уменьшить корреляцию между моделями.
Связанные темы
Ансамблирование · Переобучение и регуляризация · Вероятность и информация
Random Forest97%
Случайный лес · Классическое машинное обучениеБэггинг деревьев со случайными подвыборками объектов и признаков: усреднение резко снижает дисперсию.
Stacking and Blending85%
Стекинг и блендинг · Классическое машинное обучениеАнсамбль из разнородных моделей, поверх которых обучается мета-модель. Стандартный приём соревнований и способ выжать последние проценты.
Gradient Boosting85%
Градиентный бустинг · Классическое машинное обучениеПоследовательное построение деревьев, каждое из которых исправляет ошибки предыдущего ансамбля.
Cross-validation85%
Кросс-валидация · Оценка моделейМногократное разбиение выборки, дающее оценку качества вместе с её разбросом.
Regularization80%
Регуляризация · Оптимизация обученияЛюбое ограничение сложности модели, снижающее переобучение.
Weight Decay80%
Затухание весов · Оптимизация обученияПостепенное сжатие весов к нулю на каждом шаге оптимизации.
Early Stopping80%
Ранняя остановка · Оптимизация обученияОбучение останавливается, когда валидационная метрика перестала улучшаться.
Overfitting80%
Переобучение · Практика MLМодель запомнила обучающую выборку вместе с шумом: train-метрика отличная, val — плохая.
Underfitting80%
Недообучение · Практика MLМодель слишком проста или недоучена: ошибка велика и на train, и на валидации.
Probability70%
Теория вероятностей · ОсновыЯзык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.
Statistics70%
Статистика · ОсновыКак от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.
Information Theory70%
Теория информации · ОсновыИзмеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.
Probability Distribution70%
Распределение вероятностей · Математический справочникЗакон, задающий вероятности значений случайной величины.
Expectation70%
Математическое ожидание · Математический справочникСреднее значение случайной величины по её распределению.
Covariance70%
Ковариация · Математический справочникМера совместной изменчивости двух величин; корреляция — её нормированная версия.
Entropy70%
Энтропия · Математический справочникМера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.
KL Divergence70%
KL-дивергенция · Математический справочникНасколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.
Cross-Entropy70%
Кросс-энтропия · Математический справочникОжидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).
Bayes Theorem70%
Теорема Байеса · Математический справочникПравило пересчёта вероятности гипотезы после получения новых данных.
Naive Bayes70%
Наивный байесовский классификатор · Классическое машинное обучениеПрименяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.
Log Loss70%
Логарифмические потери · МетрикиОценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.