Обработка естественного языка

TF-IDF

TF-IDF

актуальноТекущий рабочий стандарт

Взвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.

Что означает каждый компонент
  • частота слова в документе: насколько оно важно именно здесь
  • редкость слова в корпусе: «и» встречается везде и получает почти нулевой вес

Ключевые тезисы

  • Классический бейзлайн для поиска и классификации текстов.
  • BM25 — его усовершенствованная версия, стандарт лексического поиска.
  • В гибридном поиске отлично дополняет плотные эмбеддинги.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Формула и смысл множителей

Частота в документе против редкости в корпусе.

Обозначения
  • число объектов в выборке
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • суммирование по всем перечисленным элементам
  • логарифм: превращает произведения в суммы и сжимает масштаб

Слово «и» встречается в каждом документе — его idf близок к нулю. Слово «гидроразрыв» встречается в трёх документах из миллиона — его idf огромен, и присутствие такого слова почти однозначно определяет тему.

2

BM25 — усовершенствованная версия

Стандарт лексического поиска и половина любого гибридного retrieval.

  • Насыщение по частоте: десятое вхождение слова добавляет намного меньше, чем второе.
  • Нормировка на длину документа: длинные тексты не получают преимущества автоматически.
  • Типичные параметры: , .
На практике

В RAG-системах BM25 в паре с плотными эмбеддингами почти всегда лучше любого из методов по отдельности: лексический поиск ловит точные термины и артикулы, векторный — смысл.

Связанные темы

Поиск, эмбеддинги и RAG · От слов к векторам

Embeddings95%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

Semantic Search80%

Семантический поиск · Обработка естественного языка

Поиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.

RAG80%

Retrieval-Augmented Generation · Обработка естественного языка

Языковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.

RAG80%

RAG · Генеративный ИИ

Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.

LLM80%

Большие языковые модели · Генеративный ИИ

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Agents80%

Агенты · Генеративный ИИ

LLM, которая планирует, вызывает инструменты и итеративно движется к цели.

NDCG80%

NDCG · Метрики

Нормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.

MRR80%

Средний обратный ранг · Метрики

Среднее значение 1/rank первого релевантного результата.

MAP80%

Средняя усреднённая точность · Метрики

Среднее по запросам от average precision — учитывает и релевантность, и позиции.

Precision@K80%

Точность@K · Метрики

Доля релевантных объектов среди первых K позиций выдачи.

Recall@K80%

Полнота@K · Метрики

Какая доля всех релевантных объектов попала в топ-K.

Tokenization75%

Токенизация · Обработка естественного языка

Разбиение текста на единицы, с которыми работает модель: слова, подслова или байты.

Bag of Words75%

Мешок слов · Обработка естественного языка

Текст представляется вектором частот слов, порядок полностью игнорируется.

Word2Vec75%

Word2Vec · Обработка естественного языка

Обучает плотные векторы слов по контексту: близкие по смыслу слова оказываются рядом в пространстве.

GloVe75%

GloVe · Обработка естественного языка

Строит эмбеддинги из глобальной матрицы совстречаемости слов, а не только из локальных окон.

FastText75%

FastText · Обработка естественного языка

Представляет слово суммой векторов его символьных n-грамм, что даёт эмбеддинги даже для незнакомых слов.