Отнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.
Ключевые тезисы
- Бейзлайн TF-IDF + логистическая регрессия ставится за минуты.
- Дообученный BERT обычно даёт заметный прирост качества.
- Дисбаланс классов требует взвешивания и метрик за пределами accuracy.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Практический пайплайн
От бейзлайна за пять минут до дообученного трансформера.
- Бейзлайн: TF-IDF (слова + символьные n-граммы) и логистическая регрессия.
- Быстрое улучшение: линейная модель на предобученных эмбеддингах.
- Максимум качества: дообучение BERT-подобной модели с головой-классификатором.
- Всегда: стратифицированная кросс-валидация и метрики по каждому классу.
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.linear_model import LogisticRegression
from sklearn.pipeline import make_pipeline
pipe = make_pipeline(
TfidfVectorizer(ngram_range=(1, 2), min_df=3, sublinear_tf=True),
LogisticRegression(max_iter=1000, class_weight="balanced"),
)2Дисбаланс и многоклассовость
Что делать, когда классов 50, а половина встречается по десять раз.
- Смотрите отчёт по классам (
classification_report), а не общий accuracy. - Взвешивание классов в функции потерь — первый и самый дешёвый шаг.
- Редкие классы: объединяйте в «прочее» или решайте отдельной моделью.
- Иерархическая классификация (сначала группа, затем класс внутри) часто работает лучше плоской.
Связанные темы
Работа с корпусами текстов · Прикладные задачи NLP
Topic Modeling75%
Тематическое моделирование · Обработка естественного языкаАвтоматическое выделение тем в коллекции документов: от классического LDA до кластеризации эмбеддингов.
Summarization75%
Суммаризация · Обработка естественного языкаСжатие текста с сохранением смысла: извлекающая (выбор предложений) и абстрактивная (генерация).
LLM Evaluation75%
Оценка языковых моделей · Генеративный ИИКак измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.
Perplexity75%
Перплексия · МетрикиЭкспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.
Clustering75%
Кластеризация · Обучение без учителяРазбиение объектов на группы похожих без заранее известных меток.
NER75%
Извлечение именованных сущностей · Обработка естественного языкаРазметка последовательности: находим в тексте имена, организации, даты, суммы.
Sentiment Analysis75%
Анализ тональности · Обработка естественного языкаОпределение эмоциональной окраски текста — от бинарной оценки до аспектной тональности.
BERT75%
BERT · Обработка естественного языкаДвунаправленный энкодер, предобученный на восстановлении замаскированных токенов.
Embeddings75%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
F175%
F1-мера · МетрикиГармоническое среднее точности и полноты — компромисс между ними одним числом.
Precision75%
Точность · МетрикиКакая доля объектов, предсказанных положительными, действительно положительна.
Recall75%
Полнота · МетрикиКакая доля реально положительных объектов найдена моделью.