Data
Данные
Качество данных определяет потолок качества модели. Эта глава — про подготовку, признаки и корректное разбиение выборки.
Data preprocessingактуально
Предобработка данныхПриведение сырых данных к виду, пригодному для обучения: типы, форматы, дубликаты, согласованность единиц измерения.
Missing valuesактуально
Пропущенные значенияПропуски бывают случайными и неслучайными — от механизма зависит, можно ли их просто заполнить.
Outliersактуально
ВыбросыНаблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.
Data Qualityактуально
Качество данныхиз «Инженерия данных»Автоматические проверки, которые ловят поломку источника раньше, чем она попадёт в модель.
Feature engineeringактуально
Конструирование признаковСоздание признаков, в которых закономерность становится линейно отделимой или просто более заметной для модели.
Encodingактуально
Кодирование категорийПеревод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.
Normalization & Standardizationактуально
Нормализация и стандартизацияПриведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.
Feature selectionактуально
Отбор признаковУбираем шумные и избыточные признаки, чтобы снизить переобучение, ускорить инференс и упростить интерпретацию.
Dimensionality reductionактуально
Снижение размерностиПроекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.
Feature Storesновинка
Хранилища признаковиз «MLOps»Централизованное хранилище признаков, единое для обучения и онлайн-инференса.
Feature engineeringактуально
Работа с признакамииз «Практика ML»На табличных данных грамотные признаки дают больший прирост, чем смена модели.
Data leakageактуально
Утечка данныхСитуация, когда в обучении присутствует информация, недоступная в момент реального предсказания. Главная причина «слишком хороших» метрик.
Train / Validation / Test splitактуально
Разбиение выборкиTrain учит, validation настраивает гиперпараметры, test даёт единственную честную оценку — и используется один раз.
Cross-validationактуально
Кросс-валидацияиз «Оценка моделей»Многократное разбиение выборки, дающее оценку качества вместе с её разбросом.
Synthetic Dataновинка
Синтетические данныеГенерация обучающих данных: аугментации, симуляторы и генеративные модели. Способ обойти дефицит разметки и ограничения приватности.
Imbalanced Dataактуально
Дисбаланс классовКогда положительных объектов 1% или меньше: как обучать, чем мерить и что делать с порогом.
Data Labelingактуально
Разметка данныхОрганизация разметки: инструкция, согласие аннотаторов и контроль качества. Потолок качества модели задаётся именно здесь.
Weak Supervisionновинка
Слабая разметкаиз «Практика ML»Программная разметка эвристиками и правилами вместо ручной: быстро, шумно и часто достаточно.
Active Learningактуально
Активное обучениеиз «Практика ML»Размечать в первую очередь те объекты, которые дадут наибольший прирост качества.
6 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.