Профессия в машинном обучении

Data Scientist — кто это и чем занимается

Задача бизнеса → данные → модель → измеренный эффект

Data Scientist — специалист, который превращает задачу бизнеса в модель и доказывает, что она изменила измеримый показатель. Работает на всём пути: формулировка задачи, данные, признаки, обучение, валидация, эксперимент на пользователях.

Также встречается как дата-сайентист, специалист по данным, специалист по машинному обучению, исследователь данных, Data Scientist · 13 ключевых компетенций · оси знаний: Статистика, Classic ML

Чем занимается Data Scientist

Отвечает за то, чтобы предсказание было точным и объяснимым. Много работает с данными и метриками, проверяет гипотезы и доказывает, что модель действительно что-то изменила.

  • Переводит расплывчатое пожелание («хотим меньше оттока») в задачу с целевой переменной, метрикой и бейзлайном.
  • Собирает выборку запросом к хранилищу, чистит её и строит признаки — на это уходит большая часть времени.
  • Обучает модели, чаще всего градиентный бустинг на таблицах, и подбирает гиперпараметры.
  • Строит честную схему валидации: разбиение без утечек, кросс-валидация, проверка на отложенном периоде.
  • Объясняет модель заказчику через важность признаков и SHAP, а не через саму метрику.
  • Ставит A/B-тест и защищает вывод об эффекте перед продуктовой командой.

Что нужно знать

Ядро профессии: без этих компетенций роль не складывается. У каждой — темы атласа, с которых её разбирают.

Все разделы →
Усиливает профиль, но не обязательно
Линейная алгебраАналитический SQLДисбаланс и редкие классыВизуализация данныхПодбор гиперпараметровКластеризация и снижение размерностиПоиск аномалийПрогноз временных рядовРяды и нейросетиНейросети и backpropТрекинг и версионирование

Уровни: junior, middle, senior

За что отвечает Data Scientist на каждом уровне — этим и отличается грейд.

Junior ДжуниорСчитает признаки и обучает модели по описанной постановке, проверяет качество по заданной метрике.Решает поставленную задачу по описанию, результат проходит ревью старшего.
Middle МидлСам ставит задачу с заказчиком, выбирает метрику, строит валидацию и защищает результат A/B-тестом.Ведёт задачу целиком: от постановки и данных до выкатки и мониторинга.
Senior СеньорОтвечает за выбор подхода в целом, находит ошибки в постановке до старта и ставит методологию команде.Отвечает за архитектуру решения, качество в проде и за то, чему учатся другие.

Оси знаний и плановые метки

Насколько направление профильно для роли и какой результат теста ожидается на каждом уровне. Проценты — плановые метки карьерного атласа, а не порог найма.

Все тесты →
Ось знанийЗначимостьJuniorMiddleSenior
Статистика и вероятностьпрофильная55%75%88%
Классический MLпрофильная55%75%88%
Глубокое обучениерабочая40%60%73%
NLPрабочая40%60%73%
Генеративный ИИ и LLMобзорно25%45%58%
Computer Visionобзорно25%45%58%
Временные рядырабочая40%60%73%
Рекомендательные системырабочая40%60%73%
Речь: ASR и TTSобзорно25%45%58%
MLOps и инженериярабочая40%60%73%

Как войти в профессию

Чаще всего приходят из аналитики данных, из математики или из смежной инженерной специальности. Порядок, который работает: статистика и проверка гипотез → SQL и подготовка данных → линейные модели и бустинг → метрики и валидация → анализ ошибок и A/B-тесты.

Вопросы о профессии

Чем Data Scientist отличается от ML-инженера?

Границей ответственности. Дата-сайентист отвечает за то, что модель решает верную задачу и что эффект измерен; ML-инженер — за то, что она работает в проде каждый день с нужной задержкой и не деградирует. Модели оба знают сопоставимо, но у первого больше статистики и работы с заказчиком, у второго — инженерии.

Чем Data Scientist отличается от аналитика данных?

Аналитик отвечает на вопрос «что происходит и почему» и доводит его до решения; дата-сайентист строит предсказание и отвечает за его качество. Пересечение большое — SQL, статистика, A/B-тесты, — поэтому переход из аналитики самый частый.

Какая математика нужна дата-сайентисту?

Обязательный минимум — теория вероятностей и математическая статистика: случайные величины, распределения, теорема Байеса, доверительные интервалы, ошибки первого и второго рода. Линейная алгебра и производные нужны, чтобы понимать модели, а не выводить их с нуля.

Нужно ли знать глубокое обучение?

Для табличных задач — нет, там правит градиентный бустинг. Нейросети становятся обязательными, когда в задаче появляются текст, изображения или звук; в профиле роли это обзорная ось, а не профильная.

Что учить первым?

Проверку гипотез и метрики качества. Модель без честной валидации и без верно выбранной метрики бесполезна, а вот бустинг поверх аккуратной постановки даёт результат почти сразу.