Числа, которые нужно зафиксировать до архитектуры: задержка, пропускная способность, доступность, стоимость запроса.
Ключевые тезисы
- Задержку измеряют перцентилями: p50 обманчиво, отвечают за p95 и p99.
- Требование «ответ за 50 мс» отсекает половину архитектур ещё до выбора модели.
- Доступность 99.9% — это 43 минуты простоя в месяц; закладывайте деградацию, а не отказ.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Числа, которые нужно зафиксировать
До выбора модели, а не после.
| Требование | Как формулируется | Что меняет |
|---|---|---|
| Задержка | p99 < 100 мс | архитектуру и размер модели |
| Пропускная способность | 2 000 RPS в пике | число реплик и батчинг |
| Доступность | 99.9% | резервирование и фолбэк |
| Стоимость | ≤ 0.02 ₽ за запрос | железо и квантизацию |
| Свежесть данных | признаки не старше 5 минут | стриминг или батч |
Требование к p99, а не к среднему: пользователь замечает именно долгие ответы. Хвост задержек почти всегда тяжёлый, поэтому среднее выглядит обманчиво хорошо.
2Бюджет задержки
Распределите миллисекунды между этапами.
- Сеть и балансировщик: 5–15 мс.
- Получение признаков из онлайн-хранилища: 5–20 мс.
- Инференс модели: то, что осталось.
- Сериализация и логирование: 2–5 мс.
Часто выясняется, что на саму модель остаётся 30 мс — и это сразу отсекает тяжёлые ансамбли. Такой расчёт нужно делать до обучения, а не после.
Связанные темы
Инференс и эксплуатация
Serving Architecture85%
Архитектура инференса · Системный дизайн ML-сервисовМодель внутри приложения, отдельный сервис или платформа инференса — три уровня связанности.
Caching85%
Кеширование · Системный дизайн ML-сервисовНе считать то, что уже посчитано: кеш предсказаний, признаков и эмбеддингов.
Batching and Queues85%
Батчинг и очереди · Системный дизайн ML-сервисовСобирать запросы в пачки, чтобы загрузить GPU, и сглаживать всплески нагрузки очередью.
Scaling85%
Масштабирование · Системный дизайн ML-сервисовГоризонтальное и вертикальное масштабирование инференса и правильные метрики автоскейлинга.
GPU Inference85%
GPU-инференс · Системный дизайн ML-сервисовКак выжать из видеокарты пропускную способность и не переплачивать.
Reliability85%
Отказоустойчивость · Системный дизайн ML-сервисовЧто происходит, когда модель недоступна, отвечает медленно или выдаёт мусор.
Observability85%
Наблюдаемость · Системный дизайн ML-сервисовЛоги, метрики и трассировки, по которым можно восстановить, что произошло с конкретным запросом.
Cost Model85%
Экономика сервиса · Системный дизайн ML-сервисовСтоимость одного предсказания и точка, где модель перестаёт окупаться.
LLM Serving85%
Обслуживание LLM · Системный дизайн ML-сервисовОтдельная инженерная дисциплина: KV-кеш, непрерывный батчинг, потоковая отдача и контроль стоимости.
Model Deployment85%
Деплой моделей · MLOpsДоставка модели пользователю: онлайн-сервис, батч-скоринг или встраивание в приложение.
Monitoring85%
Мониторинг · MLOpsНаблюдение за инфраструктурой, данными и качеством предсказаний после релиза.
Docker85%
Docker · MLOpsКонтейнеризация фиксирует окружение целиком: код, зависимости, системные библиотеки.
Kubernetes85%
Kubernetes · MLOpsОркестрация контейнеров: масштабирование, самовосстановление, обновления без простоя.