Обработка естественного языка

Semantic Search

Семантический поиск

новинкаНовое или быстро растущее направление

Поиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.

Ключевые тезисы

  • ANN-индексы (HNSW, IVF) обеспечивают поиск за миллисекунды.
  • Гибрид BM25 + векторы устойчивее любого из подходов по отдельности.
  • Реранкер — cross-encoder — заметно поднимает точность топа выдачи.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Гибридный поиск и реранкинг

Архитектура, которая на практике работает лучше всего.

  1. Кандидаты: BM25 и векторный поиск дают по 50–100 документов каждый.
  2. Слияние: Reciprocal Rank Fusion объединяет два списка без настройки весов.
  3. Реранкинг: cross-encoder оценивает пары «запрос — документ» и переупорядочивает топ-20.
Обозначения
  • награда, полученная агентом на шаге
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • суммирование по всем перечисленным элементам

Bi-encoder кодирует запрос и документ независимо (быстро, можно проиндексировать заранее). Cross-encoder обрабатывает их вместе (точнее, но дорого) — поэтому он применяется только к небольшому топу.

2

Как измерять качество поиска

Без оценочного набора улучшения превращаются в угадывание.

  • Соберите 50–200 реальных запросов с отмеченными релевантными документами.
  • Основные метрики: Recall@k для этапа кандидатов, NDCG@10 и MRR — для финальной выдачи.
  • Мерьте отдельно лексический, векторный и гибридный поиск — увидите, что каждый добавляет.
  • Следите за latency: реранкер cross-encoder на 100 документов может стоить сотни миллисекунд.
0.00.51.00.00.51.0FPRTPR
ROC-AUC0.983
TPR (recall)0.841
FPR0.023
Retrieval можно смотреть и как задачу ранжирования: качество отделения релевантного от нерелевантного

Связанные темы

Поиск, эмбеддинги и RAG

Embeddings80%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

RAG80%

Retrieval-Augmented Generation · Обработка естественного языка

Языковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.

TF-IDF80%

TF-IDF · Обработка естественного языка

Взвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.

RAG80%

RAG · Генеративный ИИ

Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.

LLM80%

Большие языковые модели · Генеративный ИИ

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Agents80%

Агенты · Генеративный ИИ

LLM, которая планирует, вызывает инструменты и итеративно движется к цели.

NDCG80%

NDCG · Метрики

Нормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.

MRR80%

Средний обратный ранг · Метрики

Среднее значение 1/rank первого релевантного результата.

MAP80%

Средняя усреднённая точность · Метрики

Среднее по запросам от average precision — учитывает и релевантность, и позиции.

Precision@K80%

Точность@K · Метрики

Доля релевантных объектов среди первых K позиций выдачи.

Recall@K80%

Полнота@K · Метрики

Какая доля всех релевантных объектов попала в топ-K.