Данные

Feature selection

Отбор признаков

актуальноТекущий рабочий стандарт

Убираем шумные и избыточные признаки, чтобы снизить переобучение, ускорить инференс и упростить интерпретацию.

Ключевые тезисы

  • Три семейства методов: filter (корреляции, χ²), wrapper (RFE), embedded (L1, важности деревьев).
  • Коррелированные признаки делят важность между собой и маскируют друг друга.
  • Отбор — часть pipeline, его нужно делать внутри каждого фолда кросс-валидации.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Три семейства методов отбора

Filter, wrapper, embedded: чем они отличаются по цене и качеству.

СемействоКак работаетСтоимостьПримеры
Filterстатистика признака с целью, без моделидёшевокорреляция, χ², взаимная информация
Wrapperперебор подмножеств с обучением моделидорогоRFE, последовательный отбор
Embeddedотбор происходит внутри обученияпочти бесплатноL1, важности деревьев

Filter-методы смотрят на признаки по одному и потому пропускают взаимодействия: признак может быть бесполезен сам по себе и незаменим в паре с другим.

2

Ловушки отбора

Корреляция, утечка через отбор и мнимая стабильность.

  • Коррелированные признаки делят важность: два почти одинаковых признака получат по половине и оба покажутся слабыми.
  • Отбор вне кросс-валидации — утечка: если отобрать признаки по всей выборке, а потом кроссвалидировать, оценка будет завышена. Отбор должен быть внутри фолда.
  • Нестабильность: на другой подвыборке порядок важностей может измениться. Проверяйте отбор на нескольких сидах.
На практике

Практичный порядок: убрать константы и почти-дубликаты → отбросить признаки с нулевой важностью в бустинге → проверить на кросс-валидации, что качество не упало. Это даёт и скорость, и устойчивость.

Связанные темы

Признаки: создание, отбор, важность

Feature engineering70%

Конструирование признаков · Данные

Создание признаков, в которых закономерность становится линейно отделимой или просто более заметной для модели.

Encoding70%

Кодирование категорий · Данные

Перевод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.

Feature engineering70%

Работа с признаками · Практика ML

На табличных данных грамотные признаки дают больший прирост, чем смена модели.

Feature importance70%

Важность признаков · Интерпретируемость моделей

Оценка вклада признаков в предсказания модели — первый шаг к пониманию её логики.

Permutation Importance70%

Перестановочная важность · Интерпретируемость моделей

Признак перемешивается, и измеряется падение качества модели — модельно-независимый и честный подход.

Feature Stores70%

Хранилища признаков · MLOps

Централизованное хранилище признаков, единое для обучения и онлайн-инференса.

Topological features70%

Топологические признаки · Топологический анализ данных

Векторизация топологии: энтропия персистентности, суммарная длина жизни, числа Бетти, persistence images.