Автоматическое выделение тем в коллекции документов: от классического LDA до кластеризации эмбеддингов.
Ключевые тезисы
- LDA описывает документ как смесь тем, а тему — как распределение слов.
- Число тем подбирают по когерентности, а не по правдоподобию.
- BERTopic (эмбеддинги + UMAP + HDBSCAN) обычно даёт более связные темы на коротких текстах.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1LDA
Классическая вероятностная модель тем.
Документ порождается как смесь тем, тема — как распределение слов. Обучение (вариационный вывод или сэмплирование Гиббса) восстанавливает обе матрицы: «документы × темы» и «темы × слова».
- Число тем — главный гиперпараметр; подбирают по когерентности тем, а не по правдоподобию.
- Требует лемматизации и удаления стоп-слов, иначе темы получаются мусорными.
- На коротких текстах (отзывы, посты) работает плохо — не хватает статистики.
2Современная альтернатива
Эмбеддинги + кластеризация.
- Посчитать эмбеддинги документов.
- Снизить размерность (UMAP).
- Кластеризовать (HDBSCAN).
- Описать кластер ключевыми словами через c-TF-IDF.
Такой подход (BERTopic) даёт более связные темы, работает на коротких текстах и умеет помечать документы как шум — чего LDA не умеет принципиально.
Связанные темы
Работа с корпусами текстов
Summarization75%
Суммаризация · Обработка естественного языкаСжатие текста с сохранением смысла: извлекающая (выбор предложений) и абстрактивная (генерация).
Text classification75%
Классификация текстов · Обработка естественного языкаОтнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.
LLM Evaluation75%
Оценка языковых моделей · Генеративный ИИКак измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.
Perplexity75%
Перплексия · МетрикиЭкспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.
Clustering75%
Кластеризация · Обучение без учителяРазбиение объектов на группы похожих без заранее известных меток.