Профессия в машинном обучении

Data Engineer — кто это и чем занимается

Данные приезжают вовремя, полностью и в нужном виде

Data Engineer (инженер данных) — специалист, который строит платформу данных: источники, пайплайны загрузки, хранилище, качество и контракты. Без него у моделей нет ни признаков, ни доверия к ним.

Также встречается как дата-инженер, инженер данных, Data Engineer, инженер платформы данных · 8 ключевых компетенций · оси знаний: MLOps

Чем занимается Data Engineer

Строит платформу данных: источники, пайплайны, хранилище, качество. Без него у моделей нет ни признаков, ни доверия к ним.

  • Собирает пайплайны загрузки из источников в хранилище и ставит их на расписание.
  • Проектирует схему хранения и партиционирование под то, как данные потом читают.
  • Держит батч и потоковую обработку: Kafka, Spark, идемпотентность повторных запусков.
  • Ставит проверки качества на входе и договаривается с источником о контракте данных.
  • Разбирает падения загрузок и восстанавливает данные за пропущенный период.
  • Строит хранилище признаков, чтобы обучение и онлайн видели одно и то же.

Что нужно знать

Ядро профессии: без этих компетенций роль не складывается. У каждой — темы атласа, с которых её разбирают.

Все разделы →
Усиливает профиль, но не обязательно
Трекинг и версионированиеМониторинг и дрейфРаспределённое обучениеРазбиение выборки и утечкиОтветственный ИИПроверка гипотез

Уровни: junior, middle, senior

За что отвечает Data Engineer на каждом уровне — этим и отличается грейд.

Junior ДжуниорПишет и правит задачи пайплайна по описанию, разбирает падения загрузок.Решает поставленную задачу по описанию, результат проходит ревью старшего.
Middle МидлОтвечает за поток данных целиком: источники, схема, качество, расписание, восстановление.Ведёт задачу целиком: от постановки и данных до выкатки и мониторинга.
Senior СеньорПроектирует платформу и контракты между командами, задаёт стандарты хранения и качества.Отвечает за архитектуру решения, качество в проде и за то, чему учатся другие.

Оси знаний и плановые метки

Насколько направление профильно для роли и какой результат теста ожидается на каждом уровне. Проценты — плановые метки карьерного атласа, а не порог найма.

Все тесты →
Ось знанийЗначимостьJuniorMiddleSenior
Статистика и вероятностьрабочая40%60%73%
Классический MLрабочая40%60%73%
Глубокое обучениеобзорно25%45%58%
NLPобзорно25%45%58%
Генеративный ИИ и LLMобзорно25%45%58%
Computer Visionобзорно25%45%58%
Временные рядыобзорно25%45%58%
Рекомендательные системыобзорно25%45%58%
Речь: ASR и TTSобзорно25%45%58%
MLOps и инженерияпрофильная55%75%88%

Как войти в профессию

Приходят из бэкенда и из аналитики. Ядро — SQL и понимание хранилищ, дальше оркестрация, потоковая обработка, качество данных и контейнеризация. Машинное обучение здесь обзорное: важно знать, зачем моделям признаки, а не как обучать сети.

Смежные роли и с чем путают

Куда легче всего перейти и от кого эту профессию чаще всего не отличают.

Вопросы о профессии

Нужно ли дата-инженеру машинное обучение?

На уровне понимания задачи — да: что такое признак, почему утечка данных ломает модель, зачем офлайн и онлайн должны совпадать. Обучать модели самому обычно не требуется.

Чем дата-инженер отличается от MLOps-инженера?

Предметом. Дата-инженер отвечает за поток данных, MLOps-инженер — за поток моделей. На практике они соседи и часто делят хранилище признаков и оркестратор.

Что учить первым?

Аналитический SQL и устройство хранилища: партиционирование, форматы, стоимость чтения. Оркестрация и стриминг ложатся на это сверху.

Batch или streaming?

Начинать стоит с батча — на нём видно всю механику пайплайна. Потоковая обработка нужна, когда задержка данных становится частью требований продукта.

Насколько важны контракты данных?

Это то, что отличает платформу от набора скриптов. Проверки на входе и договорённость с источником ловят большую часть инцидентов до того, как они дойдут до моделей и отчётов.