Обработка естественного языка

Sentiment Analysis

Анализ тональности

актуальноТекущий рабочий стандарт

Определение эмоциональной окраски текста — от бинарной оценки до аспектной тональности.

Ключевые тезисы

  • Ирония, отрицания и доменный сленг — главные источники ошибок.
  • Аспектный анализ отвечает не «хорошо ли», а «что именно хорошо».
  • Разметка редко бывает согласованной: оцените согласие аннотаторов.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Аспектная тональность

«Хорошо» — это мало; важно, что именно хорошо.

Пример

«Еда отличная, но официанты хамят и ждать пришлось час». Общая тональность — смешанная. Аспектная разметка: еда → положительно, обслуживание → отрицательно, скорость → отрицательно. Только вторая версия полезна ресторану.

  • Основные сложности: отрицания («не сказать, что плохо»), ирония, доменный сленг.
  • Согласие аннотаторов на тональности редко превышает 80% — это потолок качества модели.
  • Оценивать модель нужно по сегментам: короткие отзывы, отзывы с отрицаниями, разные категории товаров.
2

Как строить систему

От отзывов до дашборда, которому доверяют.

  1. Определить, что считается позитивом и негативом, и зафиксировать это в инструкции для разметчиков.
  2. Разметить 1 000–2 000 примеров, измерить согласие аннотаторов — это потолок качества.
  3. Бейзлайн TF-IDF + логистическая регрессия, затем дообученный трансформер.
  4. Отдельно оценить сегменты: короткие отзывы, отзывы с отрицаниями, разные категории.
  5. Выводить не только метку, но и уверенность; спорные случаи отправлять на ручную проверку.

Связанные темы

Прикладные задачи NLP

Text classification75%

Классификация текстов · Обработка естественного языка

Отнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.

NER75%

Извлечение именованных сущностей · Обработка естественного языка

Разметка последовательности: находим в тексте имена, организации, даты, суммы.

BERT75%

BERT · Обработка естественного языка

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

Embeddings75%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

F175%

F1-мера · Метрики

Гармоническое среднее точности и полноты — компромисс между ними одним числом.

Precision75%

Точность · Метрики

Какая доля объектов, предсказанных положительными, действительно положительна.

Recall75%

Полнота · Метрики

Какая доля реально положительных объектов найдена моделью.