Убираем шумные и избыточные признаки, чтобы снизить переобучение, ускорить инференс и упростить интерпретацию.
Ключевые тезисы
- Три семейства методов: filter (корреляции, χ²), wrapper (RFE), embedded (L1, важности деревьев).
- Коррелированные признаки делят важность между собой и маскируют друг друга.
- Отбор — часть pipeline, его нужно делать внутри каждого фолда кросс-валидации.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Три семейства методов отбора
Filter, wrapper, embedded: чем они отличаются по цене и качеству.
| Семейство | Как работает | Стоимость | Примеры |
|---|---|---|---|
| Filter | статистика признака с целью, без модели | дёшево | корреляция, χ², взаимная информация |
| Wrapper | перебор подмножеств с обучением модели | дорого | RFE, последовательный отбор |
| Embedded | отбор происходит внутри обучения | почти бесплатно | L1, важности деревьев |
Filter-методы смотрят на признаки по одному и потому пропускают взаимодействия: признак может быть бесполезен сам по себе и незаменим в паре с другим.
2Ловушки отбора
Корреляция, утечка через отбор и мнимая стабильность.
- Коррелированные признаки делят важность: два почти одинаковых признака получат по половине и оба покажутся слабыми.
- Отбор вне кросс-валидации — утечка: если отобрать признаки по всей выборке, а потом кроссвалидировать, оценка будет завышена. Отбор должен быть внутри фолда.
- Нестабильность: на другой подвыборке порядок важностей может измениться. Проверяйте отбор на нескольких сидах.
Практичный порядок: убрать константы и почти-дубликаты → отбросить признаки с нулевой важностью в бустинге → проверить на кросс-валидации, что качество не упало. Это даёт и скорость, и устойчивость.
Связанные темы
Признаки: создание, отбор, важность
Feature engineering70%
Конструирование признаков · ДанныеСоздание признаков, в которых закономерность становится линейно отделимой или просто более заметной для модели.
Encoding70%
Кодирование категорий · ДанныеПеревод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.
Feature engineering70%
Работа с признаками · Практика MLНа табличных данных грамотные признаки дают больший прирост, чем смена модели.
Feature importance70%
Важность признаков · Интерпретируемость моделейОценка вклада признаков в предсказания модели — первый шаг к пониманию её логики.
Permutation Importance70%
Перестановочная важность · Интерпретируемость моделейПризнак перемешивается, и измеряется падение качества модели — модельно-независимый и честный подход.
Feature Stores70%
Хранилища признаков · MLOpsЦентрализованное хранилище признаков, единое для обучения и онлайн-инференса.
Topological features70%
Топологические признаки · Топологический анализ данныхВекторизация топологии: энтропия персистентности, суммарная длина жизни, числа Бетти, persistence images.