Data Scientist — кто это и чем занимается
Задача бизнеса → данные → модель → измеренный эффект
Data Scientist — специалист, который превращает задачу бизнеса в модель и доказывает, что она изменила измеримый показатель. Работает на всём пути: формулировка задачи, данные, признаки, обучение, валидация, эксперимент на пользователях.
Также встречается как дата-сайентист, специалист по данным, специалист по машинному обучению, исследователь данных, Data Scientist · 13 ключевых компетенций · оси знаний: Статистика, Classic ML
Чем занимается Data Scientist
Отвечает за то, чтобы предсказание было точным и объяснимым. Много работает с данными и метриками, проверяет гипотезы и доказывает, что модель действительно что-то изменила.
- Переводит расплывчатое пожелание («хотим меньше оттока») в задачу с целевой переменной, метрикой и бейзлайном.
- Собирает выборку запросом к хранилищу, чистит её и строит признаки — на это уходит большая часть времени.
- Обучает модели, чаще всего градиентный бустинг на таблицах, и подбирает гиперпараметры.
- Строит честную схему валидации: разбиение без утечек, кросс-валидация, проверка на отложенном периоде.
- Объясняет модель заказчику через важность признаков и SHAP, а не через саму метрику.
- Ставит A/B-тест и защищает вывод об эффекте перед продуктовой командой.
Что нужно знать
Ядро профессии: без этих компетенций роль не складывается. У каждой — темы атласа, с которых её разбирают.
- Теория вероятностейядроось: Статистика и вероятность
Случайные величины, распределения, теорема Байеса.
- Проверка гипотезядроось: Статистика и вероятность
Значимость, доверительные интервалы, ошибки первого и второго рода.
- A/B-тестыядроось: Статистика и вероятность
Дизайн эксперимента и честный вывод об эффекте.
- Подготовка данныхядроось: Классический ML
Пропуски, выбросы, приведение типов и масштабов.
- Конструирование признаковядроось: Классический ML
Превращение сырых полей в то, из чего модель может учиться.
- Разбиение выборки и утечкиядроось: Классический ML
Честная схема валидации и умение заметить утечку данных.
- Линейные моделиядроось: Классический ML
Регрессия, логистическая регрессия, регуляризация.
- Деревья и бустингядроось: Классический ML
Случайный лес, градиентный бустинг, CatBoost — стандарт для таблиц.
- Метрики качестваядроось: Классический ML
Выбрать метрику под задачу и объяснить, почему не accuracy.
- Валидация и калибровкаядроось: Классический ML
Кросс-валидация, отложенная выборка, калиброванные вероятности.
- Интерпретация моделейядроось: Классический ML
SHAP, важность признаков и разговор с бизнесом на языке причин.
- Постановка задачиядроось: Классический ML
Превратить пожелание бизнеса в задачу с метрикой и бейзлайном.
- Анализ ошибок и отладкаядроось: Классический ML
Понять, где именно модель ошибается, вместо подкрутки метрики.
Уровни: junior, middle, senior
За что отвечает Data Scientist на каждом уровне — этим и отличается грейд.
Оси знаний и плановые метки
Насколько направление профильно для роли и какой результат теста ожидается на каждом уровне. Проценты — плановые метки карьерного атласа, а не порог найма.
| Ось знаний | Значимость | Junior | Middle | Senior |
|---|---|---|---|---|
| Статистика и вероятность | профильная | 55% | 75% | 88% |
| Классический ML | профильная | 55% | 75% | 88% |
| Глубокое обучение | рабочая | 40% | 60% | 73% |
| NLP | рабочая | 40% | 60% | 73% |
| Генеративный ИИ и LLM | обзорно | 25% | 45% | 58% |
| Computer Vision | обзорно | 25% | 45% | 58% |
| Временные ряды | рабочая | 40% | 60% | 73% |
| Рекомендательные системы | рабочая | 40% | 60% | 73% |
| Речь: ASR и TTS | обзорно | 25% | 45% | 58% |
| MLOps и инженерия | рабочая | 40% | 60% | 73% |
Как войти в профессию
Чаще всего приходят из аналитики данных, из математики или из смежной инженерной специальности. Порядок, который работает: статистика и проверка гипотез → SQL и подготовка данных → линейные модели и бустинг → метрики и валидация → анализ ошибок и A/B-тесты.
Смежные роли и с чем путают
Куда легче всего перейти и от кого эту профессию чаще всего не отличают.
Вопросы о профессии
Чем Data Scientist отличается от ML-инженера?
Границей ответственности. Дата-сайентист отвечает за то, что модель решает верную задачу и что эффект измерен; ML-инженер — за то, что она работает в проде каждый день с нужной задержкой и не деградирует. Модели оба знают сопоставимо, но у первого больше статистики и работы с заказчиком, у второго — инженерии.
Чем Data Scientist отличается от аналитика данных?
Аналитик отвечает на вопрос «что происходит и почему» и доводит его до решения; дата-сайентист строит предсказание и отвечает за его качество. Пересечение большое — SQL, статистика, A/B-тесты, — поэтому переход из аналитики самый частый.
Какая математика нужна дата-сайентисту?
Обязательный минимум — теория вероятностей и математическая статистика: случайные величины, распределения, теорема Байеса, доверительные интервалы, ошибки первого и второго рода. Линейная алгебра и производные нужны, чтобы понимать модели, а не выводить их с нуля.
Нужно ли знать глубокое обучение?
Для табличных задач — нет, там правит градиентный бустинг. Нейросети становятся обязательными, когда в задаче появляются текст, изображения или звук; в профиле роли это обзорная ось, а не профильная.
Что учить первым?
Проверку гипотез и метрики качества. Модель без честной валидации и без верно выбранной метрики бесполезна, а вот бустинг поверх аккуратной постановки даёт результат почти сразу.