Взвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.
- частота слова в документе: насколько оно важно именно здесь
- редкость слова в корпусе: «и» встречается везде и получает почти нулевой вес
Ключевые тезисы
- Классический бейзлайн для поиска и классификации текстов.
- BM25 — его усовершенствованная версия, стандарт лексического поиска.
- В гибридном поиске отлично дополняет плотные эмбеддинги.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Формула и смысл множителей
Частота в документе против редкости в корпусе.
- число объектов в выборке
- номер или количество: индекс шага, число соседей, кластеров или позиций
- суммирование по всем перечисленным элементам
- логарифм: превращает произведения в суммы и сжимает масштаб
Слово «и» встречается в каждом документе — его idf близок к нулю. Слово «гидроразрыв» встречается в трёх документах из миллиона — его idf огромен, и присутствие такого слова почти однозначно определяет тему.
2BM25 — усовершенствованная версия
Стандарт лексического поиска и половина любого гибридного retrieval.
- Насыщение по частоте: десятое вхождение слова добавляет намного меньше, чем второе.
- Нормировка на длину документа: длинные тексты не получают преимущества автоматически.
- Типичные параметры: , .
В RAG-системах BM25 в паре с плотными эмбеддингами почти всегда лучше любого из методов по отдельности: лексический поиск ловит точные термины и артикулы, векторный — смысл.
Связанные темы
Поиск, эмбеддинги и RAG · От слов к векторам
Embeddings95%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
Semantic Search80%
Семантический поиск · Обработка естественного языкаПоиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.
RAG80%
Retrieval-Augmented Generation · Обработка естественного языкаЯзыковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.
RAG80%
RAG · Генеративный ИИПодмешивание найденных документов в контекст модели вместо хранения знаний в весах.
LLM80%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.
Agents80%
Агенты · Генеративный ИИLLM, которая планирует, вызывает инструменты и итеративно движется к цели.
NDCG80%
NDCG · МетрикиНормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.
MRR80%
Средний обратный ранг · МетрикиСреднее значение 1/rank первого релевантного результата.
MAP80%
Средняя усреднённая точность · МетрикиСреднее по запросам от average precision — учитывает и релевантность, и позиции.
Precision@K80%
Точность@K · МетрикиДоля релевантных объектов среди первых K позиций выдачи.
Recall@K80%
Полнота@K · МетрикиКакая доля всех релевантных объектов попала в топ-K.
Tokenization75%
Токенизация · Обработка естественного языкаРазбиение текста на единицы, с которыми работает модель: слова, подслова или байты.
Bag of Words75%
Мешок слов · Обработка естественного языкаТекст представляется вектором частот слов, порядок полностью игнорируется.
Word2Vec75%
Word2Vec · Обработка естественного языкаОбучает плотные векторы слов по контексту: близкие по смыслу слова оказываются рядом в пространстве.
GloVe75%
GloVe · Обработка естественного языкаСтроит эмбеддинги из глобальной матрицы совстречаемости слов, а не только из локальных окон.
FastText75%
FastText · Обработка естественного языкаПредставляет слово суммой векторов его символьных n-грамм, что даёт эмбеддинги даже для незнакомых слов.