Приведение словоформ и написаний к единому виду: меньше вариативности — меньше словарь и лучше обобщение.
Ключевые тезисы
- Регистр, пунктуация, ё/е, юникод-формы NFKC — дешёвые шаги, которые убирают львиную долю дублей.
- Лемматизация сводит словоформы к начальной форме; стемминг делает то же грубее и быстрее.
- Для агрессивная вредна: subword-токенизация справляется сама, а регистр и пунктуация несут смысл.
Подробный разбор
- Юникод-нормализация (NFKC): одинаково выглядящие символы приводятся к одной форме — иначе «e» и «е» окажутся разными .
- Регистр: приведение к нижнему сокращает словарь примерно вдвое, но стирает разницу между «Мир» и «мир» в .
- Пунктуация и пробелы: схлопывание повторов, единый вид кавычек и тире, ё → е.
- Стемминг — грубое отсечение окончаний, быстро и без словаря.
- Лемматизация — приведение к словарной форме с учётом части речи: «бежал», «бегу» → «бежать».
Смысл всей процедуры один: сократить вариативность словоформ, чтобы словарь был меньше, а частоты — надёжнее. Для и это прямо повышает обобщающую способность: модель видит один вместо десяти его падежных вариантов.
Для правило противоположное: subword-токенизация сама разбирает словоформы, а регистр, пунктуация и эмодзи несут смысл. Агрессивная перед обычно ухудшает качество — оставляют только очистку мусора и юникод.
Профильная компетенция для ролей: NLP-инженер, Инженер речи.
Усиливает профиль: LLM-инженер.
Спрашивают на собеседовании: Яндекс — ASR / TTS, Сбер — Речевые технологии, Wildberries — Каталог, поиск и атрибуты, МТС — Речь и разговорный ИИ, HeadHunter — Тексты вакансий и резюме, 2ГИС — Геопоиск и навигация, 1С — Документы и распознавание, СКБ Контур — Документы и распознавание.
Тема встречается в тесте по направлениям — ошибки приведут обратно на эту страницу.
Глава «Обработка естественного языка» последний раз правилась . Нашли ошибку — напишите.