MLOps
MLOps
Воспроизводимость, версионирование, деплой и мониторинг: инженерная часть, из-за которой большинство ML-проектов и не доезжает до пользователя.
ML Pipelinesактуально
ML-пайплайныОформление обучения как воспроизводимой последовательности шагов вместо разрозненных ноутбуков.
Experiment Trackingактуально
Трекинг экспериментовФиксация параметров, метрик, артефактов и версии кода для каждого запуска.
MLflowактуально
MLflowОткрытая платформа для трекинга, упаковки и регистрации моделей.
Data Versioningактуально
Версионирование данныхДанные меняются чаще кода — без их версий эксперимент не воспроизвести.
Model Versioningактуально
Версионирование моделейКаждая обученная модель — артефакт с версией, метриками и происхождением.
Orchestrationактуально
Оркестрация пайплайновиз «Инженерия данных»Планировщик, который знает зависимости между задачами, повторяет упавшие и не даёт запускать одно и то же дважды.
Feature Storesновинка
Хранилища признаковЦентрализованное хранилище признаков, единое для обучения и онлайн-инференса.
Online and Offline Featuresактуально
Онлайн- и офлайн-признакииз «Системный дизайн ML-сервисов»Часть признаков считается заранее, часть — в момент запроса. Расхождение между ними — главный источник инцидентов.
Model Deploymentактуально
Деплой моделейДоставка модели пользователю: онлайн-сервис, батч-скоринг или встраивание в приложение.
Dockerактуально
DockerКонтейнеризация фиксирует окружение целиком: код, зависимости, системные библиотеки.
Kubernetesактуально
KubernetesОркестрация контейнеров: масштабирование, самовосстановление, обновления без простоя.
CI/CD for MLактуально
CI/CD для MLАвтоматизация проверок и выката: тесты кода, тесты данных, обучение и релиз модели по одной кнопке.
Serving Architectureактуально
Архитектура инференсаиз «Системный дизайн ML-сервисов»Модель внутри приложения, отдельный сервис или платформа инференса — три уровня связанности.
Drift Detectionновинка
Детекция дрейфаОбнаружение расхождения между данными обучения и данными прода.
Monitoringактуально
МониторингНаблюдение за инфраструктурой, данными и качеством предсказаний после релиза.
Retrainingактуально
Переобучение моделейРегулярное обновление модели на свежих данных по расписанию или по триггеру.
Data Qualityактуально
Качество данныхиз «Инженерия данных»Автоматические проверки, которые ловят поломку источника раньше, чем она попадёт в модель.
Observabilityактуально
Наблюдаемостьиз «Системный дизайн ML-сервисов»Логи, метрики и трассировки, по которым можно восстановить, что произошло с конкретным запросом.
Reliabilityактуально
Отказоустойчивостьиз «Системный дизайн ML-сервисов»Что происходит, когда модель недоступна, отвечает медленно или выдаёт мусор.
6 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.