Приведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.
- центрирование: вычитаем среднее, признак становится «отклонением от типичного значения»
- масштабирование на стандартное отклонение. Обе статистики берутся только по train — иначе утечка
Ключевые тезисы
- Стандартизация: вычитаем среднее, делим на стандартное отклонение; нормализация: сжимаем в [0, 1].
- Критично для k-NN, SVM, нейросетей и всех методов на основе расстояний; не нужно деревьям.
- Статистики считаются на train — иначе тест «протекает» в обучение.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Зачем масштабировать
Кому это критично, а кому безразлично.
Возраст меняется в диапазоне 20–70, доход — 20 000–500 000. Евклидово расстояние между клиентами будет определяться почти только доходом: разница в возрасте на его фоне незаметна.
| Метод | Нужно ли масштабирование |
|---|---|
| k-NN, k-means, SVM, PCA | обязательно — работают с расстояниями |
| Нейросети | обязательно — влияет на сходимость градиентов |
| Линейные модели с L1/L2 | да — иначе штраф несправедлив к признакам разного масштаба |
| Деревья, случайный лес, бустинг | не нужно — сравнения с порогом инвариантны к масштабу |
2Какой скейлер выбрать
Standard, MinMax, Robust, Quantile — четыре формулы и их свойства.
- стандартное отклонение — разброс величины
- среднее значение
- объект: вектор признаков
- Standard — дефолт для большинства задач; не ограничивает диапазон.
- MinMax — когда нужен строгий отрезок : изображения, входы некоторых сетей.
- Robust — при тяжёлых хвостах и выбросах.
- QuantileTransformer / PowerTransformer — когда нужно приблизить распределение к нормальному.
Классическая ошибка: scaler.fit(X) до разбиения на train/test. Статистики тогда «видят» тест — это утечка, и офлайн-оценка становится оптимистичной.
Связанные темы
Подготовка данных · Метрические и ядровые методы · Утечки и честная валидация
Data leakage85%
Утечка данных · ДанныеСитуация, когда в обучении присутствует информация, недоступная в момент реального предсказания. Главная причина «слишком хороших» метрик.
Train / Validation / Test split85%
Разбиение выборки · ДанныеTrain учит, validation настраивает гиперпараметры, test даёт единственную честную оценку — и используется один раз.
Data leakage85%
Утечка данных · Практика MLСамая дорогая ошибка в ML: модель отлично работает офлайн и разваливается в проде.
Cross-validation85%
Кросс-валидация · Оценка моделейМногократное разбиение выборки, дающее оценку качества вместе с её разбросом.
K-Fold85%
K-Fold · Оценка моделейДанные делятся на K частей; каждая по очереди становится валидационной.
Stratified K-Fold85%
Стратифицированный K-Fold · Оценка моделейK-Fold с сохранением пропорции классов в каждом фолде.
Leave-One-Out85%
Leave-One-Out · Оценка моделейПредельный случай: валидация состоит ровно из одного объекта, и так N раз.
Bootstrap85%
Бутстрэп · Оценка моделейМногократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.
Data preprocessing75%
Предобработка данных · ДанныеПриведение сырых данных к виду, пригодному для обучения: типы, форматы, дубликаты, согласованность единиц измерения.
Missing values75%
Пропущенные значения · ДанныеПропуски бывают случайными и неслучайными — от механизма зависит, можно ли их просто заполнить.
Outliers75%
Выбросы · ДанныеНаблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.
Encoding75%
Кодирование категорий · ДанныеПеревод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.
Feature engineering75%
Конструирование признаков · ДанныеСоздание признаков, в которых закономерность становится линейно отделимой или просто более заметной для модели.
ML Pipelines75%
ML-пайплайны · MLOpsОформление обучения как воспроизводимой последовательности шагов вместо разрозненных ноутбуков.
k-NN65%
Метод k ближайших соседей · Классическое машинное обучениеЛенивый алгоритм: предсказание — это голосование k ближайших объектов обучающей выборки.
SVM65%
Метод опорных векторов · Классическое машинное обучениеИщет гиперплоскость с максимальным зазором между классами; ядровой трюк добавляет нелинейность без явного перехода в новое пространство.
k-Means65%
k-средних · Классическое машинное обучениеРазбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.
Distance65%
Расстояние · Математический справочникМера непохожести объектов — основа кластеризации, k-NN и поиска.
Norm65%
Норма · Математический справочникМера длины вектора; выбор нормы определяет геометрию задачи.
Metric spaces65%
Метрические пространства · Топологический анализ данныхМножество с функцией расстояния. Любой TDA-пайплайн начинается с выбора метрики.