Системный дизайн ML-сервисов

Requirements and SLA

Требования и SLA

актуальноТекущий рабочий стандарт

Числа, которые нужно зафиксировать до архитектуры: задержка, пропускная способность, доступность, стоимость запроса.

Ключевые тезисы

  • Задержку измеряют перцентилями: p50 обманчиво, отвечают за p95 и p99.
  • Требование «ответ за 50 мс» отсекает половину архитектур ещё до выбора модели.
  • Доступность 99.9% — это 43 минуты простоя в месяц; закладывайте деградацию, а не отказ.
Тема также относится к главам:Практика MLПродакшен

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Числа, которые нужно зафиксировать

До выбора модели, а не после.

ТребованиеКак формулируетсяЧто меняет
Задержкаp99 < 100 мсархитектуру и размер модели
Пропускная способность2 000 RPS в пикечисло реплик и батчинг
Доступность99.9%резервирование и фолбэк
Стоимость≤ 0.02 ₽ за запросжелезо и квантизацию
Свежесть данныхпризнаки не старше 5 минутстриминг или батч
На практике

Требование к p99, а не к среднему: пользователь замечает именно долгие ответы. Хвост задержек почти всегда тяжёлый, поэтому среднее выглядит обманчиво хорошо.

2

Бюджет задержки

Распределите миллисекунды между этапами.

  • Сеть и балансировщик: 5–15 мс.
  • Получение признаков из онлайн-хранилища: 5–20 мс.
  • Инференс модели: то, что осталось.
  • Сериализация и логирование: 2–5 мс.

Часто выясняется, что на саму модель остаётся 30 мс — и это сразу отсекает тяжёлые ансамбли. Такой расчёт нужно делать до обучения, а не после.

Связанные темы

Инференс и эксплуатация

Serving Architecture85%

Архитектура инференса · Системный дизайн ML-сервисов

Модель внутри приложения, отдельный сервис или платформа инференса — три уровня связанности.

Caching85%

Кеширование · Системный дизайн ML-сервисов

Не считать то, что уже посчитано: кеш предсказаний, признаков и эмбеддингов.

Batching and Queues85%

Батчинг и очереди · Системный дизайн ML-сервисов

Собирать запросы в пачки, чтобы загрузить GPU, и сглаживать всплески нагрузки очередью.

Scaling85%

Масштабирование · Системный дизайн ML-сервисов

Горизонтальное и вертикальное масштабирование инференса и правильные метрики автоскейлинга.

GPU Inference85%

GPU-инференс · Системный дизайн ML-сервисов

Как выжать из видеокарты пропускную способность и не переплачивать.

Reliability85%

Отказоустойчивость · Системный дизайн ML-сервисов

Что происходит, когда модель недоступна, отвечает медленно или выдаёт мусор.

Observability85%

Наблюдаемость · Системный дизайн ML-сервисов

Логи, метрики и трассировки, по которым можно восстановить, что произошло с конкретным запросом.

Cost Model85%

Экономика сервиса · Системный дизайн ML-сервисов

Стоимость одного предсказания и точка, где модель перестаёт окупаться.

LLM Serving85%

Обслуживание LLM · Системный дизайн ML-сервисов

Отдельная инженерная дисциплина: KV-кеш, непрерывный батчинг, потоковая отдача и контроль стоимости.

Model Deployment85%

Деплой моделей · MLOps

Доставка модели пользователю: онлайн-сервис, батч-скоринг или встраивание в приложение.

Monitoring85%

Мониторинг · MLOps

Наблюдение за инфраструктурой, данными и качеством предсказаний после релиза.

Docker85%

Docker · MLOps

Контейнеризация фиксирует окружение целиком: код, зависимости, системные библиотеки.

Kubernetes85%

Kubernetes · MLOps

Оркестрация контейнеров: масштабирование, самовосстановление, обновления без простоя.