MLOps

Monitoring

Мониторинг

актуальноТекущий рабочий стандарт

Наблюдение за инфраструктурой, данными и качеством предсказаний после релиза.

Ключевые тезисы

  • Технические метрики: латентность, ошибки, потребление ресурсов.
  • Продуктовые метрики важнее ML-метрик, но приходят с задержкой.
  • Логируйте входы и предсказания — без них расследовать инцидент невозможно.
Тема также относится к главам:Системный дизайн ML-сервисовЭксплуатация

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Три слоя мониторинга

Инфраструктура, данные, качество.

СлойМетрикиЗадержка сигнала
Инфраструктураlatency, RPS, ошибки, памятьсекунды
Данныедоля пропусков, распределения, новые категорииминуты
Качество моделиметрика на разметке, бизнес-показателидни или недели
На практике

Между предсказанием и появлением истинной метки часто проходят недели (дефолт по кредиту, отток). Поэтому мониторинг данных — единственный ранний сигнал, и он должен быть настроен с первого дня.

2

Алерты, на которые реагируют

Главная проблема мониторинга — усталость от ложных срабатываний.

  • Пороги ставьте по историческому разбросу метрики, а не «на глаз».
  • Требуйте устойчивости: алерт после N последовательных нарушений, а не первого выброса.
  • У каждого алерта должен быть владелец и понятный первый шаг разбора.
  • Регулярно ревизуйте: алерт, который все игнорируют, хуже отсутствия алерта.

Связанные темы

Инференс и эксплуатация · Безопасность и приватность ML · Продакшен и эксплуатация

Model Deployment97%

Деплой моделей · MLOps

Доставка модели пользователю: онлайн-сервис, батч-скоринг или встраивание в приложение.

Docker97%

Docker · MLOps

Контейнеризация фиксирует окружение целиком: код, зависимости, системные библиотеки.

Kubernetes97%

Kubernetes · MLOps

Оркестрация контейнеров: масштабирование, самовосстановление, обновления без простоя.

Requirements and SLA85%

Требования и SLA · Системный дизайн ML-сервисов

Числа, которые нужно зафиксировать до архитектуры: задержка, пропускная способность, доступность, стоимость запроса.

Serving Architecture85%

Архитектура инференса · Системный дизайн ML-сервисов

Модель внутри приложения, отдельный сервис или платформа инференса — три уровня связанности.

Caching85%

Кеширование · Системный дизайн ML-сервисов

Не считать то, что уже посчитано: кеш предсказаний, признаков и эмбеддингов.

Batching and Queues85%

Батчинг и очереди · Системный дизайн ML-сервисов

Собирать запросы в пачки, чтобы загрузить GPU, и сглаживать всплески нагрузки очередью.

Scaling85%

Масштабирование · Системный дизайн ML-сервисов

Горизонтальное и вертикальное масштабирование инференса и правильные метрики автоскейлинга.

GPU Inference85%

GPU-инференс · Системный дизайн ML-сервисов

Как выжать из видеокарты пропускную способность и не переплачивать.

Reliability85%

Отказоустойчивость · Системный дизайн ML-сервисов

Что происходит, когда модель недоступна, отвечает медленно или выдаёт мусор.

Observability85%

Наблюдаемость · Системный дизайн ML-сервисов

Логи, метрики и трассировки, по которым можно восстановить, что произошло с конкретным запросом.

Cost Model85%

Экономика сервиса · Системный дизайн ML-сервисов

Стоимость одного предсказания и точка, где модель перестаёт окупаться.

LLM Serving85%

Обслуживание LLM · Системный дизайн ML-сервисов

Отдельная инженерная дисциплина: KV-кеш, непрерывный батчинг, потоковая отдача и контроль стоимости.

Drift Detection80%

Детекция дрейфа · MLOps

Обнаружение расхождения между данными обучения и данными прода.

Retraining80%

Переобучение моделей · MLOps

Регулярное обновление модели на свежих данных по расписанию или по триггеру.

ML Pipelines80%

ML-пайплайны · MLOps

Оформление обучения как воспроизводимой последовательности шагов вместо разрозненных ноутбуков.

Production ML80%

ML в продакшене · Практика ML

Модель в проде — это сервис с SLA, мониторингом, версионированием и планом отката.

Privacy and Security70%

Приватность и безопасность · Системный дизайн ML-сервисов

Персональные данные, доступы и специфические для ML риски.

Agents70%

Агенты · Генеративный ИИ

LLM, которая планирует, вызывает инструменты и итеративно движется к цели.

Prompting70%

Промптинг · Генеративный ИИ

Управление поведением модели через формулировку запроса, без изменения весов.

Data Contracts70%

Контракты данных · Инженерия данных

Явная договорённость между источником и потребителем: какие поля, каких типов и с какими гарантиями.