Обработка естественного языка

Topic Modeling

Тематическое моделирование

классикаLDA вытесняется кластеризацией эмбеддингов; идея смеси тем остаётся полезной.

Автоматическое выделение тем в коллекции документов: от классического LDA до кластеризации эмбеддингов.

Ключевые тезисы

  • LDA описывает документ как смесь тем, а тему — как распределение слов.
  • Число тем подбирают по когерентности, а не по правдоподобию.
  • BERTopic (эмбеддинги + UMAP + HDBSCAN) обычно даёт более связные темы на коротких текстах.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

LDA

Классическая вероятностная модель тем.

Документ порождается как смесь тем, тема — как распределение слов. Обучение (вариационный вывод или сэмплирование Гиббса) восстанавливает обе матрицы: «документы × темы» и «темы × слова».

  • Число тем — главный гиперпараметр; подбирают по когерентности тем, а не по правдоподобию.
  • Требует лемматизации и удаления стоп-слов, иначе темы получаются мусорными.
  • На коротких текстах (отзывы, посты) работает плохо — не хватает статистики.
2

Современная альтернатива

Эмбеддинги + кластеризация.

  1. Посчитать эмбеддинги документов.
  2. Снизить размерность (UMAP).
  3. Кластеризовать (HDBSCAN).
  4. Описать кластер ключевыми словами через c-TF-IDF.
На практике

Такой подход (BERTopic) даёт более связные темы, работает на коротких текстах и умеет помечать документы как шум — чего LDA не умеет принципиально.

Связанные темы

Работа с корпусами текстов