Данные

Outliers

Выбросы

актуальноТекущий рабочий стандарт

Наблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.

Ключевые тезисы

  • Методы обнаружения: z-score, IQR, Isolation Forest, LOF, расстояние Махаланобиса.
  • Линейные модели и MSE крайне чувствительны к выбросам, деревья — почти нет.
  • Прежде чем удалять выброс, стоит понять его природу: в фрод-детекции это и есть цель.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Как находить выбросы

Четыре рабочих метода: от простого z-score до Isolation Forest.

Обозначения
  • стандартное отклонение — разброс величины
  • среднее значение
  • объект: вектор признаков
Правило трёх сигм работает только для примерно нормальных данных
Метод Тьюки не требует нормальности и устойчив к самим выбросам
  • Isolation Forest — случайные разбиения; аномалия отделяется за меньшее число разрезов.
  • LOF — сравнивает локальную плотность объекта с плотностью его соседей.
  • Расстояние Махаланобиса — многомерный аналог z-score, учитывает корреляции признаков.
2

Что с ними делать

Удалять — самый частый и самый опасный ответ.

Сначала классифицируйте выброс: это ошибка ввода (возраст 999), редкое, но настоящее наблюдение (зарплата топ-менеджера) или именно то, что вы ищете (мошенническая транзакция).

ТипДействие
Ошибка данныхисправить или превратить в пропуск
Редкое настоящее значениеоставить, но выбрать устойчивую модель или обрезать (winsorize)
Целевое событиене трогать — это и есть сигнал
На практике

Линейные модели и MSE крайне чувствительны к выбросам, деревья почти нет. Иногда правильный ответ — не чистить данные, а сменить функцию потерь на MAE или Huber.

-3-1130246ошибка y − ŷпотериMSEMAEHuber
MSE4.00
MAE2.00
Huber1.50
Задача
MSE растёт квадратично: один объект с ошибкой 10 весит как сто объектов с ошибкой 1

Связанные темы

Тяжёлые хвосты и риск · Подготовка данных · Аномалии и выбросы

Power Law75%

Степенное распределение · Теория вероятностей и распределения

Плотность убывает как степень: редкие события встречаются намного чаще, чем предсказывает нормальный закон. Распределения Парето и Ципфа — его классические формы.

Heavy Tails75%

Тяжёлые хвосты · Теория вероятностей и распределения

Распределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.

Extreme Value Theory75%

Теория экстремальных значений · Теория вероятностей и распределения

Аппарат для моделирования максимумов и хвостов: как оценить вероятность события, которого ещё не случалось.

Log-normal Distribution75%

Логнормальное распределение · Теория вероятностей и распределения

Величина, логарифм которой нормален. Возникает там, где эффекты перемножаются, а не складываются.

Complex Systems75%

Сложные системы · Динамические системы и фракталы

Системы из множества взаимодействующих элементов, где коллективное поведение не сводится к сумме частей.

Self-similarity75%

Самоподобие · Динамические системы и фракталы

Свойство структуры повторять себя на разных масштабах — точно или статистически.

Scale-free Networks75%

Безмасштабные сети · Графы и сети

Сети, в которых распределение степеней вершин подчиняется степенному закону: немного «хабов» и очень много слабо связанных вершин.

MAPE75%

Средняя абсолютная процентная ошибка · Метрики

Относительная ошибка в процентах — удобна для сравнения рядов разного масштаба.

Data preprocessing75%

Предобработка данных · Данные

Приведение сырых данных к виду, пригодному для обучения: типы, форматы, дубликаты, согласованность единиц измерения.

Missing values75%

Пропущенные значения · Данные

Пропуски бывают случайными и неслучайными — от механизма зависит, можно ли их просто заполнить.

Encoding75%

Кодирование категорий · Данные

Перевод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.

Normalization & Standardization75%

Нормализация и стандартизация · Данные

Приведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.

Feature engineering75%

Конструирование признаков · Данные

Создание признаков, в которых закономерность становится линейно отделимой или просто более заметной для модели.

ML Pipelines75%

ML-пайплайны · MLOps

Оформление обучения как воспроизводимой последовательности шагов вместо разрозненных ноутбуков.

Anomaly Detection70%

Поиск аномалий · Обучение без учителя

Выделение объектов, не похожих на основную массу данных, при отсутствии меток.

Anomaly detection70%

Поиск аномалий во времени · Временные ряды

Обнаружение точечных выбросов, сдвигов уровня и аномальных подпоследовательностей.

Autoencoders70%

Автоэнкодеры · Глубокое обучение

Сеть учится восстанавливать вход через узкое место, получая сжатое представление.

Density Estimation70%

Оценка плотности · Обучение без учителя

Восстановление распределения данных: где объекты встречаются часто, а где почти никогда.

TDA + Time Series70%

TDA и временные ряды · Топологический анализ данных

Ряд вкладывается в фазовое пространство (Такенс), и топология полученного облака описывает динамику системы.