MLOps

ML Pipelines

ML-пайплайны

актуальноТекущий рабочий стандарт

Оформление обучения как воспроизводимой последовательности шагов вместо разрозненных ноутбуков.

Ключевые тезисы

  • Один и тот же код готовит данные в обучении и в инференсе.
  • Оркестраторы: Airflow, Dagster, Kubeflow, Prefect.
  • Кэширование шагов экономит часы при повторных запусках.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Из чего состоит пайплайн

Шаги, артефакты и зависимости между ними.

  1. Загрузка и валидация сырых данных (схема, диапазоны, доля пропусков).
  2. Подготовка признаков — тот же код, что будет в проде.
  3. Обучение с фиксированным seed и логированием параметров.
  4. Оценка и валидационные гейты: не выпускать модель хуже текущей.
  5. Регистрация артефакта модели вместе с версиями данных и кода.
На практике

Оркестратор (Airflow, Dagster, Kubeflow) нужен не ради красоты графа, а ради повторяемости, ретраев и кэширования: перезапуск после сбоя не должен считать всё заново.

2

Валидация данных на входе

Дешёвая проверка, которая ловит большинство инцидентов.

  • Схема: набор колонок, типы, обязательность.
  • Диапазоны: возраст 0–120, вероятность 0–1, суммы неотрицательны.
  • Доля пропусков по каждой колонке против исторической нормы.
  • Мощность категориальных признаков: внезапные новые категории — сигнал.
На практике

Пайплайн должен падать громко при нарушении контракта данных. Тихо обученная на мусоре модель дороже упавшего джоба.

Связанные темы

Платформа данных · Подготовка данных · Продакшен и эксплуатация · Воспроизводимость

Data Versioning95%

Версионирование данных · MLOps

Данные меняются чаще кода — без их версий эксперимент не воспроизвести.

Warehouse, Lake, Lakehouse80%

Хранилище, озеро, lakehouse · Инженерия данных

Три способа хранить аналитические данные: строгая схема, сырые файлы или гибрид с транзакциями поверх объектного хранилища.

File Formats80%

Форматы хранения · Инженерия данных

Колоночные форматы против строковых: почему Parquet почти всегда лучше CSV для аналитики.

Partitioning80%

Партиционирование · Инженерия данных

Разделение данных по ключу (обычно по дате), чтобы запрос читал минимум файлов.

Analytical SQL80%

Аналитический SQL · Инженерия данных

Оконные функции, агрегации и CTE — основной инструмент подготовки признаков на больших данных.

ETL vs ELT80%

ETL и ELT · Инженерия данных

Преобразовывать данные до загрузки или уже внутри хранилища — и почему индустрия сместилась ко второму.

Batch and Streaming80%

Батч и стриминг · Инженерия данных

Обработка по расписанию против непрерывной обработки событий. Разные задержки, разные гарантии, разная стоимость.

Orchestration80%

Оркестрация пайплайнов · Инженерия данных

Планировщик, который знает зависимости между задачами, повторяет упавшие и не даёт запускать одно и то же дважды.

Spark80%

Spark · Инженерия данных

Распределённая обработка больших объёмов данных: тот случай, когда данные не помещаются на одну машину.

Kafka80%

Kafka · Инженерия данных

Распределённый журнал событий: основа потоковой архитектуры и источник данных для онлайн-признаков.

Model Deployment80%

Деплой моделей · MLOps

Доставка модели пользователю: онлайн-сервис, батч-скоринг или встраивание в приложение.

Monitoring80%

Мониторинг · MLOps

Наблюдение за инфраструктурой, данными и качеством предсказаний после релиза.

Drift Detection80%

Детекция дрейфа · MLOps

Обнаружение расхождения между данными обучения и данными прода.

Retraining80%

Переобучение моделей · MLOps

Регулярное обновление модели на свежих данных по расписанию или по триггеру.

Docker80%

Docker · MLOps

Контейнеризация фиксирует окружение целиком: код, зависимости, системные библиотеки.

Kubernetes80%

Kubernetes · MLOps

Оркестрация контейнеров: масштабирование, самовосстановление, обновления без простоя.

Production ML80%

ML в продакшене · Практика ML

Модель в проде — это сервис с SLA, мониторингом, версионированием и планом отката.

Data preprocessing75%

Предобработка данных · Данные

Приведение сырых данных к виду, пригодному для обучения: типы, форматы, дубликаты, согласованность единиц измерения.

Missing values75%

Пропущенные значения · Данные

Пропуски бывают случайными и неслучайными — от механизма зависит, можно ли их просто заполнить.

Outliers75%

Выбросы · Данные

Наблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.

Encoding75%

Кодирование категорий · Данные

Перевод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.

Normalization & Standardization75%

Нормализация и стандартизация · Данные

Приведение признаков к сопоставимым масштабам, без которого расстояния, градиенты и регуляризация работают некорректно.

Feature engineering75%

Конструирование признаков · Данные

Создание признаков, в которых закономерность становится линейно отделимой или просто более заметной для модели.

Experiment Tracking75%

Трекинг экспериментов · MLOps

Фиксация параметров, метрик, артефактов и версии кода для каждого запуска.

MLflow75%

MLflow · MLOps

Открытая платформа для трекинга, упаковки и регистрации моделей.

Model Versioning75%

Версионирование моделей · MLOps

Каждая обученная модель — артефакт с версией, метриками и происхождением.

Ablation studies75%

Абляционные исследования · Оценка моделей

Поочерёдное отключение компонентов, чтобы понять, что именно даёт прирост качества.