Данные

Normalization & Standardization

Нормализация и стандартизация

актуальноТекущий рабочий стандарт

Приведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.

Что означает каждый компонент
  • центрирование: вычитаем среднее, признак становится «отклонением от типичного значения»
  • масштабирование на стандартное отклонение. Обе статистики берутся только по train — иначе утечка

Ключевые тезисы

  • Стандартизация: вычитаем среднее, делим на стандартное отклонение; нормализация: сжимаем в [0, 1].
  • Критично для k-NN, SVM, нейросетей и всех методов на основе расстояний; не нужно деревьям.
  • Статистики считаются на train — иначе тест «протекает» в обучение.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Зачем масштабировать

Кому это критично, а кому безразлично.

Возраст меняется в диапазоне 20–70, доход — 20 000–500 000. Евклидово расстояние между клиентами будет определяться почти только доходом: разница в возрасте на его фоне незаметна.

МетодНужно ли масштабирование
k-NN, k-means, SVM, PCAобязательно — работают с расстояниями
Нейросетиобязательно — влияет на сходимость градиентов
Линейные модели с L1/L2да — иначе штраф несправедлив к признакам разного масштаба
Деревья, случайный лес, бустингне нужно — сравнения с порогом инвариантны к масштабу
возрастдоход
возраст23.00 … 61.00
доход45000.00 … 210000.00
Преобразование
Два признака до и после разных преобразований — обратите внимание, что делает выброс со StandardScaler
2

Какой скейлер выбрать

Standard, MinMax, Robust, Quantile — четыре формулы и их свойства.

Обозначения
  • стандартное отклонение — разброс величины
  • среднее значение
  • объект: вектор признаков
Robust опирается на квантили и почти не реагирует на выбросы
  • Standard — дефолт для большинства задач; не ограничивает диапазон.
  • MinMax — когда нужен строгий отрезок : изображения, входы некоторых сетей.
  • Robust — при тяжёлых хвостах и выбросах.
  • QuantileTransformer / PowerTransformer — когда нужно приблизить распределение к нормальному.
На практике

Классическая ошибка: scaler.fit(X) до разбиения на train/test. Статистики тогда «видят» тест — это утечка, и офлайн-оценка становится оптимистичной.

Связанные темы

Подготовка данных · Метрические и ядровые методы · Утечки и честная валидация

Data leakage85%

Утечка данных · Данные

Ситуация, когда в обучении присутствует информация, недоступная в момент реального предсказания. Главная причина «слишком хороших» метрик.

Train / Validation / Test split85%

Разбиение выборки · Данные

Train учит, validation настраивает гиперпараметры, test даёт единственную честную оценку — и используется один раз.

Data leakage85%

Утечка данных · Практика ML

Самая дорогая ошибка в ML: модель отлично работает офлайн и разваливается в проде.

Cross-validation85%

Кросс-валидация · Оценка моделей

Многократное разбиение выборки, дающее оценку качества вместе с её разбросом.

K-Fold85%

K-Fold · Оценка моделей

Данные делятся на K частей; каждая по очереди становится валидационной.

Stratified K-Fold85%

Стратифицированный K-Fold · Оценка моделей

K-Fold с сохранением пропорции классов в каждом фолде.

Leave-One-Out85%

Leave-One-Out · Оценка моделей

Предельный случай: валидация состоит ровно из одного объекта, и так N раз.

Bootstrap85%

Бутстрэп · Оценка моделей

Многократная выборка с возвращением: даёт распределение метрики и доверительные интервалы без предположений о нормальности.

Data preprocessing75%

Предобработка данных · Данные

Приведение сырых данных к виду, пригодному для обучения: типы, форматы, дубликаты, согласованность единиц измерения.

Missing values75%

Пропущенные значения · Данные

Пропуски бывают случайными и неслучайными — от механизма зависит, можно ли их просто заполнить.

Outliers75%

Выбросы · Данные

Наблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.

Encoding75%

Кодирование категорий · Данные

Перевод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.

Feature engineering75%

Конструирование признаков · Данные

Создание признаков, в которых закономерность становится линейно отделимой или просто более заметной для модели.

ML Pipelines75%

ML-пайплайны · MLOps

Оформление обучения как воспроизводимой последовательности шагов вместо разрозненных ноутбуков.

k-NN65%

Метод k ближайших соседей · Классическое машинное обучение

Ленивый алгоритм: предсказание — это голосование k ближайших объектов обучающей выборки.

SVM65%

Метод опорных векторов · Классическое машинное обучение

Ищет гиперплоскость с максимальным зазором между классами; ядровой трюк добавляет нелинейность без явного перехода в новое пространство.

k-Means65%

k-средних · Классическое машинное обучение

Разбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.

Distance65%

Расстояние · Математический справочник

Мера непохожести объектов — основа кластеризации, k-NN и поиска.

Norm65%

Норма · Математический справочник

Мера длины вектора; выбор нормы определяет геометрию задачи.

Metric spaces65%

Метрические пространства · Топологический анализ данных

Множество с функцией расстояния. Любой TDA-пайплайн начинается с выбора метрики.