Классическое машинное обучение

Isolation Forest

Isolation Forest

актуальноТекущий рабочий стандарт

Обнаружение аномалий случайными разбиениями: аномальный объект отделяется от остальных за меньшее число разрезов.

Ключевые тезисы

  • Не требует разметки и хорошо масштабируется: сложность почти линейна по числу объектов.
  • Работает с многомерными данными лучше, чем методы на основе плотности.
  • Параметр contamination задаёт ожидаемую долю аномалий и напрямую определяет порог.
Тема также относится к главам:Обучение без учителяПлотность и аномалии

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Идея изоляции

Аномалию отделить проще, чем обычный объект.

Алгоритм строит случайные деревья, выбирая случайный признак и случайный порог. Аномальные объекты отсекаются от остальных за меньшее число разбиений, поэтому их средняя глубина в деревьях мала.

Обозначения
  • математическое ожидание — среднее по распределению
  • объект: вектор признаков
  • число объектов в выборке
Скор близкий к 1 — аномалия, около 0.5 — обычный объект
2

Практика применения

Параметры и подводные камни.

  • contamination задаёт долю аномалий и напрямую определяет порог — выбирайте его по бюджету проверок.
  • Метод плохо работает с категориальными признаками и требует осмысленного кодирования.
  • Не находит «локальные» аномалии внутри плотного кластера — для них нужен LOF.
  • Хорошо масштабируется: подвыборка 256 объектов на дерево — стандарт.

Связанные темы

Редкие классы и события