Раздел 16

MLOps

MLOps

Воспроизводимость, версионирование, деплой и мониторинг: инженерная часть, из-за которой большинство ML-проектов и не доезжает до пользователя.

2 новинок11 актуальныхИнженерное направление
новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

ML Pipelinesактуально

ML-пайплайны

Оформление обучения как воспроизводимой последовательности шагов вместо разрозненных ноутбуков.

Experiment Trackingактуально

Трекинг экспериментов

Фиксация параметров, метрик, артефактов и версии кода для каждого запуска.

MLflowактуально

MLflow

Открытая платформа для трекинга, упаковки и регистрации моделей.

Data Versioningактуально

Версионирование данных

Данные меняются чаще кода — без их версий эксперимент не воспроизвести.

Model Versioningактуально

Версионирование моделей

Каждая обученная модель — артефакт с версией, метриками и происхождением.

Orchestrationактуально

Оркестрация пайплайновиз «Инженерия данных»

Планировщик, который знает зависимости между задачами, повторяет упавшие и не даёт запускать одно и то же дважды.

Feature Storesновинка

Хранилища признаков

Централизованное хранилище признаков, единое для обучения и онлайн-инференса.

Online and Offline Featuresактуально

Онлайн- и офлайн-признакииз «Системный дизайн ML-сервисов»

Часть признаков считается заранее, часть — в момент запроса. Расхождение между ними — главный источник инцидентов.

Model Deploymentактуально

Деплой моделей

Доставка модели пользователю: онлайн-сервис, батч-скоринг или встраивание в приложение.

Dockerактуально

Docker

Контейнеризация фиксирует окружение целиком: код, зависимости, системные библиотеки.

Kubernetesактуально

Kubernetes

Оркестрация контейнеров: масштабирование, самовосстановление, обновления без простоя.

CI/CD for MLактуально

CI/CD для ML

Автоматизация проверок и выката: тесты кода, тесты данных, обучение и релиз модели по одной кнопке.

Serving Architectureактуально

Архитектура инференсаиз «Системный дизайн ML-сервисов»

Модель внутри приложения, отдельный сервис или платформа инференса — три уровня связанности.

Drift Detectionновинка

Детекция дрейфа

Обнаружение расхождения между данными обучения и данными прода.

Monitoringактуально

Мониторинг

Наблюдение за инфраструктурой, данными и качеством предсказаний после релиза.

Retrainingактуально

Переобучение моделей

Регулярное обновление модели на свежих данных по расписанию или по триггеру.

Data Qualityактуально

Качество данныхиз «Инженерия данных»

Автоматические проверки, которые ловят поломку источника раньше, чем она попадёт в модель.

Observabilityактуально

Наблюдаемостьиз «Системный дизайн ML-сервисов»

Логи, метрики и трассировки, по которым можно восстановить, что произошло с конкретным запросом.

Reliabilityактуально

Отказоустойчивостьиз «Системный дизайн ML-сервисов»

Что происходит, когда модель недоступна, отвечает медленно или выдаёт мусор.

6 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.