MLOps-инженер — кто это и чем занимается
Платформа, на которой чужие модели живут долго
MLOps-инженер — специалист, который делает эксплуатацию машинного обучения предсказуемой: обучение воспроизводится, выкатка становится рутиной, а деградация модели замечается раньше пользователей. Работает не с одной моделью, а с их потоком.
Также встречается как MLOps-инженер, инженер MLOps, ML Platform Engineer, инженер ML-платформы, MLOps / ML Platform Engineer · 9 ключевых компетенций · оси знаний: MLOps
Чем занимается MLOps-инженер
Делает так, чтобы обучение воспроизводилось, выкатка была рутиной, а деградация замечалась раньше пользователей. Работает не с одной моделью, а с их потоком.
- Строит и держит инфраструктуру обучения: окружения, образы, доступ к GPU.
- Делает путь модели от эксперимента до прода одинаковым для всех команд.
- Настраивает CI/CD для моделей: тесты, сборка, выкатка, откат.
- Ставит мониторинг качества, дрейфа и стоимости инференса.
- Ведёт реестр моделей, версии данных и трекинг экспериментов.
- Отвечает за экономику платформы: утилизация карт, изоляция команд, лимиты.
Что нужно знать
Ядро профессии: без этих компетенций роль не складывается. У каждой — темы атласа, с которых её разбирают.
- Docker и Kubernetesядроось: MLOps и инженерия
Одинаковое окружение и управляемая выкатка сервисов.
- Пайплайны и оркестрацияядроось: MLOps и инженерия
Воспроизводимая цепочка шагов и расписание запусков.
- Деплой и инференсядроось: MLOps и инженерия
Как модель становится сервисом с задержкой и SLA.
- Мониторинг и дрейфядроось: MLOps и инженерия
Что смотреть после выкатки и когда переобучать.
- Трекинг и версионированиеядроось: MLOps и инженерия
Эксперименты, модели и данные, которые можно повторить.
- Хранилище признаковядроось: MLOps и инженерия
Одинаковые признаки в обучении и в онлайне.
- Распределённое обучениеядроось: MLOps и инженерия
Несколько карт и узлов: как разделить работу и не потерять ускорение.
- PyTorch и GPUядроось: MLOps и инженерия
Где считается модель, как занять карту и не упереться в память.
- Системный дизайн MLядроось: MLOps и инженерия
Требования, масштабирование и экономика сервиса.
Уровни: junior, middle, senior
За что отвечает MLOps-инженер на каждом уровне — этим и отличается грейд.
Оси знаний и плановые метки
Насколько направление профильно для роли и какой результат теста ожидается на каждом уровне. Проценты — плановые метки карьерного атласа, а не порог найма.
| Ось знаний | Значимость | Junior | Middle | Senior |
|---|---|---|---|---|
| Статистика и вероятность | обзорно | 25% | 45% | 58% |
| Классический ML | рабочая | 40% | 60% | 73% |
| Глубокое обучение | рабочая | 40% | 60% | 73% |
| NLP | обзорно | 25% | 45% | 58% |
| Генеративный ИИ и LLM | рабочая | 40% | 60% | 73% |
| Computer Vision | обзорно | 25% | 45% | 58% |
| Временные ряды | обзорно | 25% | 45% | 58% |
| Рекомендательные системы | обзорно | 25% | 45% | 58% |
| Речь: ASR и TTS | обзорно | 25% | 45% | 58% |
| MLOps и инженерия | профильная | 55% | 75% | 88% |
Как войти в профессию
Приходят из DevOps, из бэкенда и из ML-инженерии. Из DevOps добирают модели, метрики и дрейф; из ML — Kubernetes, распределённое обучение и эксплуатацию. Профильная ось одна — MLOps, но она самая широкая.
Смежные роли и с чем путают
Куда легче всего перейти и от кого эту профессию чаще всего не отличают.
Вопросы о профессии
MLOps — это DevOps для машинного обучения?
Не только. К обычной эксплуатации добавляются вещи, которых в DevOps нет: версии данных, дрейф распределений, воспроизводимость обучения и правило переобучения. Модель ломается тихо, без падения сервиса.
Нужно ли уметь обучать модели?
Нужно понимать процесс и метрики достаточно, чтобы отличить деградацию модели от проблемы инфраструктуры. Обучать самому обычно не приходится.
Какой стек ожидают?
Docker и Kubernetes, оркестрация пайплайнов, CI/CD, трекинг экспериментов и реестр моделей, хранилище признаков, мониторинг. Плюс GPU: как их делить и как не упереться в память.
Чем занимается MLOps-инженер, когда моделей мало?
Строит то, чем моделей станет много: шаблон пайплайна, стандарт выкатки, единый мониторинг. В маленькой команде роль обычно совмещена с ML-инженером.
Что учить первым?
Контейнеры и оркестрацию пайплайнов — на них держится всё остальное. Мониторинг и дрейф идут следом, когда есть что выкатывать.