Профессия в машинном обучении

NLP-инженер — кто это и чем занимается

Текст как данные: понять, извлечь, классифицировать

NLP-инженер — специалист по обработке естественного языка: превращает текст в данные и решает на них задачи классификации, извлечения сущностей, поиска и суммаризации. Отвечает за качество на реальных, грязных текстах, а не на чистом датасете.

Также встречается как NLP-инженер, инженер обработки естественного языка, специалист по NLP, NLP Engineer · 8 ключевых компетенций · оси знаний: DL, NLP

Чем занимается NLP-инженер

Работает с языком: от токенизации и эмбеддингов до трансформеров под конкретную задачу. Отвечает за качество на реальных, грязных текстах.

  • Готовит текст: токенизация, нормализация, работа с опечатками и разметкой источника.
  • Считает эмбеддинги и строит семантический поиск по коллекции документов.
  • Дообучает трансформеры под задачу: классификация, NER, суммаризация.
  • Организует разметку и проверяет её согласованность.
  • Подбирает метрику под задачу и разбирает ошибки по типам, а не по среднему числу.
  • Отдаёт модель в сервис и следит за задержкой и стоимостью на реальном потоке текстов.

Что нужно знать

Ядро профессии: без этих компетенций роль не складывается. У каждой — темы атласа, с которых её разбирают.

Все разделы →
Усиливает профиль, но не обязательно
LLM и промптингДообучение LLMRAG и агентыОбучение и оптимизаторыPyTorch и GPUДеплой и инференсВалидация и калибровка

Уровни: junior, middle, senior

За что отвечает NLP-инженер на каждом уровне — этим и отличается грейд.

Junior ДжуниорДообучает готовую модель под задачу и считает метрики на подготовленных данных.Решает поставленную задачу по описанию, результат проходит ревью старшего.
Middle МидлВедёт задачу целиком: разметка, выбор архитектуры, оценка и выкатка.Ведёт задачу целиком: от постановки и данных до выкатки и мониторинга.
Senior СеньорОтвечает за языковой стек продукта и за компромиссы между качеством, задержкой и стоимостью.Отвечает за архитектуру решения, качество в проде и за то, чему учатся другие.

Оси знаний и плановые метки

Насколько направление профильно для роли и какой результат теста ожидается на каждом уровне. Проценты — плановые метки карьерного атласа, а не порог найма.

Все тесты →
Ось знанийЗначимостьJuniorMiddleSenior
Статистика и вероятностьрабочая40%60%73%
Классический MLрабочая40%60%73%
Глубокое обучениепрофильная55%75%88%
NLPпрофильная55%75%88%
Генеративный ИИ и LLMрабочая40%60%73%
Computer Visionобзорно25%45%58%
Временные рядыобзорно25%45%58%
Рекомендательные системыобзорно25%45%58%
Речь: ASR и TTSобзорно25%45%58%
MLOps и инженериярабочая40%60%73%

Как войти в профессию

Обычный путь — из общего ML или из разработки через глубокое обучение. Порядок: базовая обработка текста → эмбеддинги → трансформеры и перенос обучения → задачи NLP и их метрики. Дальше расходится в сторону LLM или речи.

Вопросы о профессии

Чем NLP-инженер отличается от LLM-инженера?

NLP-инженер решает задачу над текстом и часто сам обучает модель под неё; LLM-инженер строит продукт поверх готовой большой модели — RAG, агенты, дообучение — и отвечает ещё и за стоимость ответа. Ось языка профильная у обоих, но у второго центр тяжести смещён к продукту.

Нужны ли ещё классические методы, если есть трансформеры?

Да. TF-IDF и линейная модель — законный бейзлайн: они дешёвые, объяснимые и нередко достаточные. Без бейзлайна невозможно доказать, что тяжёлая модель что-то дала.

Насколько важна разметка?

Обычно она и есть узкое место. Несогласованная разметка задаёт потолок качества, который не пробить ни архитектурой, ни объёмом данных.

Какая математика нужна?

Линейная алгебра для эмбеддингов и внимания, вероятности и энтропия для функций потерь и метрик генерации. Глубже — по мере необходимости.

Что учить первым?

Токенизацию и эмбеддинги: на них держатся и поиск, и классификация, и всё, что происходит внутри трансформера.