MLOps

Model Deployment

Деплой моделей

актуальноТекущий рабочий стандарт

Доставка модели пользователю: онлайн-сервис, батч-скоринг или встраивание в приложение.

Ключевые тезисы

  • REST/gRPC-сервис в контейнере — самый частый вариант.
  • Canary и shadow-развёртывание снижают риск выката.
  • Требования по латентности определяют архитектуру больше, чем качество модели.
Тема также относится к главам:Системный дизайн ML-сервисовПроектирование

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Способы доставки модели

Онлайн, батч, стрим, на устройстве.

ПаттернЗадержкаКогда
Онлайн-сервисмиллисекундырешение нужно в момент запроса
Батч-скорингчасырассылки, скоринг базы, отчёты
Стримингсекундыантифрод, мониторинг событий
На устройствемгновенноофлайн, приватность
  • Shadow — модель считает, но её ответы не используются; сравниваем с текущей.
  • Canary — 5% трафика на новую версию, при отсутствии деградации доводим до 100%.
  • Blue-green — мгновенное переключение и такой же мгновенный откат.
2

Оптимизация инференса

Как уложиться в SLA и бюджет.

  • Квантизация (int8) — обычно двукратное ускорение при потере качества в пределах шума.
  • ONNX Runtime / TensorRT — компиляция графа под конкретное железо.
  • Батчинг запросов даёт кратный рост пропускной способности ценой небольшой задержки.
  • Кэш предсказаний для повторяющихся входов — иногда самый дешёвый выигрыш.

Связанные темы

Доставка модели в прод · Инференс и эксплуатация · Продакшен и эксплуатация

Serving Architecture98%

Архитектура инференса · Системный дизайн ML-сервисов

Модель внутри приложения, отдельный сервис или платформа инференса — три уровня связанности.

Production ML97%

ML в продакшене · Практика ML

Модель в проде — это сервис с SLA, мониторингом, версионированием и планом отката.

Monitoring97%

Мониторинг · MLOps

Наблюдение за инфраструктурой, данными и качеством предсказаний после релиза.

Docker97%

Docker · MLOps

Контейнеризация фиксирует окружение целиком: код, зависимости, системные библиотеки.

Kubernetes97%

Kubernetes · MLOps

Оркестрация контейнеров: масштабирование, самовосстановление, обновления без простоя.

CI/CD for ML85%

CI/CD для ML · MLOps

Автоматизация проверок и выката: тесты кода, тесты данных, обучение и релиз модели по одной кнопке.

Model Versioning85%

Версионирование моделей · MLOps

Каждая обученная модель — артефакт с версией, метриками и происхождением.

MLflow85%

MLflow · MLOps

Открытая платформа для трекинга, упаковки и регистрации моделей.

Requirements and SLA85%

Требования и SLA · Системный дизайн ML-сервисов

Числа, которые нужно зафиксировать до архитектуры: задержка, пропускная способность, доступность, стоимость запроса.

Caching85%

Кеширование · Системный дизайн ML-сервисов

Не считать то, что уже посчитано: кеш предсказаний, признаков и эмбеддингов.

Batching and Queues85%

Батчинг и очереди · Системный дизайн ML-сервисов

Собирать запросы в пачки, чтобы загрузить GPU, и сглаживать всплески нагрузки очередью.

Scaling85%

Масштабирование · Системный дизайн ML-сервисов

Горизонтальное и вертикальное масштабирование инференса и правильные метрики автоскейлинга.

GPU Inference85%

GPU-инференс · Системный дизайн ML-сервисов

Как выжать из видеокарты пропускную способность и не переплачивать.

Reliability85%

Отказоустойчивость · Системный дизайн ML-сервисов

Что происходит, когда модель недоступна, отвечает медленно или выдаёт мусор.

Observability85%

Наблюдаемость · Системный дизайн ML-сервисов

Логи, метрики и трассировки, по которым можно восстановить, что произошло с конкретным запросом.

Cost Model85%

Экономика сервиса · Системный дизайн ML-сервисов

Стоимость одного предсказания и точка, где модель перестаёт окупаться.

LLM Serving85%

Обслуживание LLM · Системный дизайн ML-сервисов

Отдельная инженерная дисциплина: KV-кеш, непрерывный батчинг, потоковая отдача и контроль стоимости.

Drift Detection80%

Детекция дрейфа · MLOps

Обнаружение расхождения между данными обучения и данными прода.

Retraining80%

Переобучение моделей · MLOps

Регулярное обновление модели на свежих данных по расписанию или по триггеру.

ML Pipelines80%

ML-пайплайны · MLOps

Оформление обучения как воспроизводимой последовательности шагов вместо разрозненных ноутбуков.