Выделение объектов, не похожих на основную массу данных, при отсутствии меток.
Ключевые тезисы
- Isolation Forest, One-Class SVM, LOF, автоэнкодеры.
- Порог решает всё: он задаёт баланс пропусков и ложных срабатываний.
- Даже небольшая размеченная выборка резко упрощает валидацию.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Основные методы
Изоляция, плотность, расстояние и реконструкция.
| Метод | Идея | Сильная сторона |
|---|---|---|
| Isolation Forest | аномалию легче «отрезать» случайными разбиениями | быстрый, масштабируемый |
| LOF | плотность объекта против плотности соседей | локальные аномалии |
| One-Class SVM | граница вокруг нормальных данных | малые выборки |
| Автоэнкодер | большая ошибка реконструкции | сложные структурированные данные |
Все они возвращают не метку, а скор аномальности. Порог — это отдельное решение, которое определяет баланс между пропусками и ложными тревогами и обычно диктуется тем, сколько сигналов способна разобрать команда.
2Выбор порога
Скор без порога бесполезен.
- По бюджету проверок: сколько сигналов в день команда способна разобрать — столько и берём сверху.
- По квантилю: помечаем верхний 1% скоров, если ожидаемая доля аномалий известна.
- По размеченной выборке: даже сотня примеров позволяет подобрать порог осмысленно.
Всегда считайте, во что обходится ложная тревога. Детектор, генерирующий 500 алертов в день, будет отключён через неделю независимо от его метрик.
Связанные темы
Редкие классы и события · Аномалии и выбросы
Imbalanced Data80%
Дисбаланс классов · ДанныеКогда положительных объектов 1% или меньше: как обучать, чем мерить и что делать с порогом.
Isolation Forest80%
Isolation Forest · Классическое машинное обучениеОбнаружение аномалий случайными разбиениями: аномальный объект отделяется от остальных за меньшее число разрезов.
PR-AUC80%
PR-AUC · МетрикиПлощадь под кривой precision–recall; честнее ROC-AUC при редком положительном классе.
MCC80%
Коэффициент Мэтьюса · МетрикиКорреляция между предсказаниями и истиной, учитывающая все четыре ячейки матрицы ошибок.
Loss functions80%
Функции потерь · Глубокое обучениеФормализуют цель обучения. Выбор потерь важнее выбора архитектуры чаще, чем кажется.
Extreme Value Theory80%
Теория экстремальных значений · Теория вероятностей и распределенияАппарат для моделирования максимумов и хвостов: как оценить вероятность события, которого ещё не случалось.
Outliers70%
Выбросы · ДанныеНаблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.
Anomaly detection70%
Поиск аномалий во времени · Временные рядыОбнаружение точечных выбросов, сдвигов уровня и аномальных подпоследовательностей.
Autoencoders70%
Автоэнкодеры · Глубокое обучениеСеть учится восстанавливать вход через узкое место, получая сжатое представление.
Density Estimation70%
Оценка плотности · Обучение без учителяВосстановление распределения данных: где объекты встречаются часто, а где почти никогда.
TDA + Time Series70%
TDA и временные ряды · Топологический анализ данныхРяд вкладывается в фазовое пространство (Такенс), и топология полученного облака описывает динамику системы.