ML System Design
Системный дизайн ML-сервисов
Инженерная глава о том, что окружает модель: требования и SLA, архитектура инференса, кеши, очереди, стоимость, приватность и наблюдаемость. Здесь решается, доживёт ли модель до пользователя.
Requirements and SLAактуально
Требования и SLAЧисла, которые нужно зафиксировать до архитектуры: задержка, пропускная способность, доступность, стоимость запроса.
Serving Architectureактуально
Архитектура инференсаМодель внутри приложения, отдельный сервис или платформа инференса — три уровня связанности.
Online and Offline Featuresактуально
Онлайн- и офлайн-признакиЧасть признаков считается заранее, часть — в момент запроса. Расхождение между ними — главный источник инцидентов.
Cost Modelактуально
Экономика сервисаСтоимость одного предсказания и точка, где модель перестаёт окупаться.
Model Deploymentактуально
Деплой моделейиз «MLOps»Доставка модели пользователю: онлайн-сервис, батч-скоринг или встраивание в приложение.
Dockerактуально
Dockerиз «MLOps»Контейнеризация фиксирует окружение целиком: код, зависимости, системные библиотеки.
GPU Inferenceновинка
GPU-инференсКак выжать из видеокарты пропускную способность и не переплачивать.
LLM Servingновинка
Обслуживание LLMОтдельная инженерная дисциплина: KV-кеш, непрерывный батчинг, потоковая отдача и контроль стоимости.
Cachingактуально
КешированиеНе считать то, что уже посчитано: кеш предсказаний, признаков и эмбеддингов.
Batching and Queuesактуально
Батчинг и очередиСобирать запросы в пачки, чтобы загрузить GPU, и сглаживать всплески нагрузки очередью.
Scalingактуально
МасштабированиеГоризонтальное и вертикальное масштабирование инференса и правильные метрики автоскейлинга.
LLMновинка
Большие языковые моделииз «Генеративный ИИ»Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.
Kubernetesактуально
Kubernetesиз «MLOps»Оркестрация контейнеров: масштабирование, самовосстановление, обновления без простоя.
Privacy and Securityновинка
Приватность и безопасностьПерсональные данные, доступы и специфические для ML риски.
Reliabilityактуально
ОтказоустойчивостьЧто происходит, когда модель недоступна, отвечает медленно или выдаёт мусор.
Observabilityактуально
НаблюдаемостьЛоги, метрики и трассировки, по которым можно восстановить, что произошло с конкретным запросом.
Experiment Infrastructureактуально
Инфраструктура экспериментовМеханика раскатки: разделение трафика, стабильные группы, метрики и автоматический откат.
Monitoringактуально
Мониторингиз «MLOps»Наблюдение за инфраструктурой, данными и качеством предсказаний после релиза.
A/B testingактуально
A/B-тестированиеиз «Оценка моделей»Онлайн-эксперимент, который единственный честно измеряет влияние модели на продуктовые метрики.
6 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.