Создание признаков, в которых закономерность становится линейно отделимой или просто более заметной для модели.
Ключевые тезисы
- Агрегаты, разности, отношения, лаги и оконные статистики — рабочая лошадка табличных задач.
- Доменные знания дают признаки, которые модель не выведет из сырых столбцов.
- Каждый новый признак — риск утечки: проверяйте, доступен ли он в момент предсказания.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Типовые приёмы конструирования
Отношения, агрегаты, лаги, календарь — что почти всегда работает на табличных данных.
- Отношения и разности: цена за квадратный метр, доля погашенного долга, разница между зарплатой и средней по региону.
- Агрегаты по группам: средний чек клиента, число заказов за 30 дней, стандартное отклонение суммы транзакций.
- Лаги и окна (для рядов): значение неделю назад, скользящее среднее за 7 дней, минимум за месяц.
- Календарь: день недели, праздник, номер недели, час — циклические признаки лучше кодировать синусом и косинусом.
2Полиномиальные признаки и взаимодействия
Как научить линейную модель ловить нелинейность.
Линейная модель не умеет умножать признаки друг на друга. Если эффект признака зависит от другого («скидка работает только на дорогих товарах»), это взаимодействие нужно добавить руками.
Число признаков растёт как : 50 признаков во второй степени превращаются в 1325. Дальше обязательна регуляризация, иначе переобучение гарантировано. Деревьям и бустингу такие признаки нужны редко — они ловят взаимодействия сами.
Связанные темы
Признаки в реальном времени · Подготовка данных · Признаки: создание, отбор, важность
Feature Stores96%
Хранилища признаков · MLOpsЦентрализованное хранилище признаков, единое для обучения и онлайн-инференса.
Feature engineering96%
Работа с признаками · Практика MLНа табличных данных грамотные признаки дают больший прирост, чем смена модели.
Encoding93%
Кодирование категорий · ДанныеПеревод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.
Online and Offline Features85%
Онлайн- и офлайн-признаки · Системный дизайн ML-сервисовЧасть признаков считается заранее, часть — в момент запроса. Расхождение между ними — главный источник инцидентов.
Batch and Streaming85%
Батч и стриминг · Инженерия данныхОбработка по расписанию против непрерывной обработки событий. Разные задержки, разные гарантии, разная стоимость.
Change Data Capture85%
Захват изменений (CDC) · Инженерия данныхЧтение журнала изменений базы вместо периодических полных выгрузок.
Data preprocessing75%
Предобработка данных · ДанныеПриведение сырых данных к виду, пригодному для обучения: типы, форматы, дубликаты, согласованность единиц измерения.
Missing values75%
Пропущенные значения · ДанныеПропуски бывают случайными и неслучайными — от механизма зависит, можно ли их просто заполнить.
Outliers75%
Выбросы · ДанныеНаблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.
Normalization & Standardization75%
Нормализация и стандартизация · ДанныеПриведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.
ML Pipelines75%
ML-пайплайны · MLOpsОформление обучения как воспроизводимой последовательности шагов вместо разрозненных ноутбуков.
Feature selection70%
Отбор признаков · ДанныеУбираем шумные и избыточные признаки, чтобы снизить переобучение, ускорить инференс и упростить интерпретацию.
Feature importance70%
Важность признаков · Интерпретируемость моделейОценка вклада признаков в предсказания модели — первый шаг к пониманию её логики.
Permutation Importance70%
Перестановочная важность · Интерпретируемость моделейПризнак перемешивается, и измеряется падение качества модели — модельно-независимый и честный подход.
Topological features70%
Топологические признаки · Топологический анализ данныхВекторизация топологии: энтропия персистентности, суммарная длина жизни, числа Бетти, persistence images.