Обработка естественного языка

Text Normalization

Нормализация текста

актуальноТекущий рабочий стандарт

Направления: Прикладные направления · NLP

Приведение словоформ и написаний к единому виду: меньше вариативности — меньше словарь и лучше обобщение.

Ключевые тезисы

  • Регистр, пунктуация, ё/е, юникод-формы NFKC — дешёвые шаги, которые убирают львиную долю дублей.
  • Лемматизация сводит словоформы к начальной форме; стемминг делает то же грубее и быстрее.
  • Для агрессивная вредна: subword-токенизация справляется сама, а регистр и пунктуация несут смысл.

Подробный разбор

1 подтема — объяснения, формулы, примеры и интерактивные графики.

  1. Юникод-нормализация (NFKC): одинаково выглядящие символы приводятся к одной форме — иначе «e» и «е» окажутся разными .
  2. Регистр: приведение к нижнему сокращает словарь примерно вдвое, но стирает разницу между «Мир» и «мир» в .
  3. Пунктуация и пробелы: схлопывание повторов, единый вид кавычек и тире, ё → е.
  4. Стемминг — грубое отсечение окончаний, быстро и без словаря.
  5. Лемматизация — приведение к словарной форме с учётом части речи: «бежал», «бегу» → «бежать».

Смысл всей процедуры один: сократить вариативность словоформ, чтобы словарь был меньше, а частоты — надёжнее. Для и это прямо повышает обобщающую способность: модель видит один вместо десяти его падежных вариантов.

На практике

Для правило противоположное: subword-токенизация сама разбирает словоформы, а регистр, пунктуация и эмодзи несут смысл. Агрессивная перед обычно ухудшает качество — оставляют только очистку мусора и юникод.

Проверить себя

Тема встречается в тесте по направлениям — ошибки приведут обратно на эту страницу.

Следующий шагПроверить себя: Речь: ASR и TTSТема встречается в этом тесте 2 раза. Ошибка приведёт обратно на эту страницу — с объяснением, что именно не сошлось.Перейти →

Глава «Обработка естественного языка» последний раз правилась . Нашли ошибку — напишите.