Интерпретируемость моделей

Feature importance

Важность признаков

актуальноТекущий рабочий стандарт

Оценка вклада признаков в предсказания модели — первый шаг к пониманию её логики.

Ключевые тезисы

  • Встроенная важность деревьев смещена в сторону признаков с высокой кардинальностью.
  • Важность показывает связь, а не причинность.
  • Неожиданно доминирующий признак — почти всегда признак утечки.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Виды важностей и их смещения

Одно слово «важность» скрывает три разные величины.

ТипКак считаетсяСмещение
Gain (деревья)суммарное снижение неоднородностив пользу признаков с большим числом значений
Split countсколько раз признак использованто же плюс зависимость от глубины
Permutationпадение качества после перемешиванияделится между коррелированными
SHAPвклад по значениям Шеплиаддитивен, но дорог
На практике

Важность отражает связь, а не причинность. Признак может быть важным потому, что он следствие целевой переменной — и это прямой признак утечки.

2

Как показывать важности бизнесу

Чтобы выводы были верными, а не просто красивыми.

  • Группируйте связанные признаки (все лаги одного показателя — одна строка отчёта).
  • Показывайте не только величину, но и направление влияния — это даёт SHAP, а не gain.
  • Прямо оговаривайте: это корреляция, а не причина; для причинных выводов нужен эксперимент.
  • Сравнивайте важности на нескольких сидах — нестабильный порядок означает, что различия внутри шума.

Связанные темы

Признаки: создание, отбор, важность

Feature engineering70%

Конструирование признаков · Данные

Создание признаков, в которых закономерность становится линейно отделимой или просто более заметной для модели.

Encoding70%

Кодирование категорий · Данные

Перевод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.

Feature selection70%

Отбор признаков · Данные

Убираем шумные и избыточные признаки, чтобы снизить переобучение, ускорить инференс и упростить интерпретацию.

Feature engineering70%

Работа с признаками · Практика ML

На табличных данных грамотные признаки дают больший прирост, чем смена модели.

Permutation Importance70%

Перестановочная важность · Интерпретируемость моделей

Признак перемешивается, и измеряется падение качества модели — модельно-независимый и честный подход.

Feature Stores70%

Хранилища признаков · MLOps

Централизованное хранилище признаков, единое для обучения и онлайн-инференса.

Topological features70%

Топологические признаки · Топологический анализ данных

Векторизация топологии: энтропия персистентности, суммарная длина жизни, числа Бетти, persistence images.