Обработка естественного языка

NER

Извлечение именованных сущностей

актуальноТекущий рабочий стандарт

Разметка последовательности: находим в тексте имена, организации, даты, суммы.

Ключевые тезисы

  • Схема BIO кодирует границы сущностей на уровне токенов.
  • Метрики считаются по сущностям целиком, а не по токенам.
  • Гибрид правил и модели часто эффективнее чистого ML на узких доменах.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Схема BIO и метрики

Как размечают границы сущностей и как считают качество.

ТокенМетка
ИванB-PER
ПетровI-PER
работаетO
вO
СбербанкеB-ORG

Метрики считают по сущностям целиком: сущность засчитана только если совпали и границы, и тип. Токенная accuracy здесь бесполезна — класс O доминирует и даёт 95% почти бесплатно.

На практике

На узких доменах (номера договоров, артикулы, даты в специфичном формате) гибрид правил и модели обычно точнее чистого ML — регулярное выражение не ошибается там, где формат жёсткий.

2

Практические приёмы

Как довести NER до продакшена.

  • Согласованность разметки важнее объёма: определите правила («включать ли отчество в PER») и проверьте согласие аннотаторов.
  • Постобработка: словари организаций, проверка форматов ИНН/КПП, склейка разорванных сущностей.
  • Активное обучение: размечайте в первую очередь примеры, на которых модель менее всего уверена.
  • Метрики по типам: обычно PER распознаётся отлично, а ORG и LOC путаются между собой.

Связанные темы

Прикладные задачи NLP

Text classification75%

Классификация текстов · Обработка естественного языка

Отнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.

Sentiment Analysis75%

Анализ тональности · Обработка естественного языка

Определение эмоциональной окраски текста — от бинарной оценки до аспектной тональности.

BERT75%

BERT · Обработка естественного языка

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

Embeddings75%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

F175%

F1-мера · Метрики

Гармоническое среднее точности и полноты — компромисс между ними одним числом.

Precision75%

Точность · Метрики

Какая доля объектов, предсказанных положительными, действительно положительна.

Recall75%

Полнота · Метрики

Какая доля реально положительных объектов найдена моделью.