Оценка вклада признаков в предсказания модели — первый шаг к пониманию её логики.
Ключевые тезисы
- Встроенная важность деревьев смещена в сторону признаков с высокой кардинальностью.
- Важность показывает связь, а не причинность.
- Неожиданно доминирующий признак — почти всегда признак утечки.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Виды важностей и их смещения
Одно слово «важность» скрывает три разные величины.
| Тип | Как считается | Смещение |
|---|---|---|
| Gain (деревья) | суммарное снижение неоднородности | в пользу признаков с большим числом значений |
| Split count | сколько раз признак использован | то же плюс зависимость от глубины |
| Permutation | падение качества после перемешивания | делится между коррелированными |
| SHAP | вклад по значениям Шепли | аддитивен, но дорог |
Важность отражает связь, а не причинность. Признак может быть важным потому, что он следствие целевой переменной — и это прямой признак утечки.
2Как показывать важности бизнесу
Чтобы выводы были верными, а не просто красивыми.
- Группируйте связанные признаки (все лаги одного показателя — одна строка отчёта).
- Показывайте не только величину, но и направление влияния — это даёт SHAP, а не gain.
- Прямо оговаривайте: это корреляция, а не причина; для причинных выводов нужен эксперимент.
- Сравнивайте важности на нескольких сидах — нестабильный порядок означает, что различия внутри шума.
Связанные темы
Признаки: создание, отбор, важность
Feature engineering70%
Конструирование признаков · ДанныеСоздание признаков, в которых закономерность становится линейно отделимой или просто более заметной для модели.
Encoding70%
Кодирование категорий · ДанныеПеревод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.
Feature selection70%
Отбор признаков · ДанныеУбираем шумные и избыточные признаки, чтобы снизить переобучение, ускорить инференс и упростить интерпретацию.
Feature engineering70%
Работа с признаками · Практика MLНа табличных данных грамотные признаки дают больший прирост, чем смена модели.
Permutation Importance70%
Перестановочная важность · Интерпретируемость моделейПризнак перемешивается, и измеряется падение качества модели — модельно-независимый и честный подход.
Feature Stores70%
Хранилища признаков · MLOpsЦентрализованное хранилище признаков, единое для обучения и онлайн-инференса.
Topological features70%
Топологические признаки · Топологический анализ данныхВекторизация топологии: энтропия персистентности, суммарная длина жизни, числа Бетти, persistence images.