Когда положительных объектов 1% или меньше: как обучать, чем мерить и что делать с порогом.
Ключевые тезисы
- Перевзвешивание классов почти всегда лучше и дешевле, чем передискретизация.
- SMOTE помогает на малых табличных выборках и почти бесполезен на больших и на изображениях.
- Любой ресэмплинг делается только внутри фолда и ломает калибровку вероятностей.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Что делать с дисбалансом
Четыре подхода по возрастанию сложности.
| Приём | Как работает | Риск |
|---|---|---|
| Веса классов | редкий класс весит больше в функции потерь | ломает калибровку |
| Undersampling | выбрасываем часть большого класса | теряем данные |
| Oversampling / SMOTE | дублируем или синтезируем редкий класс | переобучение на синтетике |
| Порог + правильная метрика | модель не трогаем, меняем решение | ничего не ломает |
Начинайте с последней строки: часто «проблема дисбаланса» — это на самом деле проблема выбора метрики и порога, а не обучения.
2Где здесь ошибаются
Три ловушки, встречающиеся почти в каждом проекте.
- Ресэмплинг до разбиения: синтетические объекты попадают и в train, и в валидацию — метрика взлетает.
- Accuracy как метрика: при 1% положительных она бесполезна; смотрите PR-AUC и MCC.
- Потеря калибровки: после перевзвешивания вероятности смещены — калибруйте отдельно, если они нужны.
Связанные темы
Редкие классы и события
Isolation Forest80%
Isolation Forest · Классическое машинное обучениеОбнаружение аномалий случайными разбиениями: аномальный объект отделяется от остальных за меньшее число разрезов.
Anomaly Detection80%
Поиск аномалий · Обучение без учителяВыделение объектов, не похожих на основную массу данных, при отсутствии меток.
PR-AUC80%
PR-AUC · МетрикиПлощадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.
MCC80%
Коэффициент Мэтьюса · МетрикиКорреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.
Loss functions80%
Функции потерь · Глубокое обучениеФормализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.
Extreme Value Theory80%
Теория экстремальных значений · Теория вероятностей и распределенияАппарат для моделирования максимумов и хвостов: как оценить вероятность события, которого ещё не случалось.