Какая доля всех релевантных объектов попала в топ-K.
Ключевые тезисы
- Основная метрика этапа кандидатогенерации в рекомендациях.
- Растёт с ростом K по определению.
- В связке с precision@K показывает баланс охвата и чистоты выдачи.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Метрика этапа отбора кандидатов
Главное число двухэтапных рекомендательных систем.
Кандидатогенерация отбирает, скажем, 500 товаров из миллиона, а реранкер расставляет их точно. Если нужный товар не попал в эти 500, никакой реранкер уже не поможет — поэтому на первом этапе максимизируют именно Recall@K.
2Как выбрать K
Баланс между полнотой и стоимостью реранкинга.
- Постройте кривую Recall@K для K = 10, 50, 100, 500, 1000.
- Найдите точку, где рост полноты замедляется — дальше вы платите за реранкинг зря.
- Учтите бюджет: cross-encoder на 500 документов может не уложиться в SLA.
Recall@100 = 0.86, Recall@500 = 0.91, Recall@1000 = 0.92. Разумный выбор — 100 или 500: последний скачок в 1 п.п. стоит вдвое дороже.
Связанные темы
Поиск, эмбеддинги и RAG
Embeddings80%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
Semantic Search80%
Семантический поиск · Обработка естественного языкаПоиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.
RAG80%
Retrieval-Augmented Generation · Обработка естественного языкаЯзыковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.
TF-IDF80%
TF-IDF · Обработка естественного языкаВзвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.
RAG80%
RAG · Генеративный ИИПодмешивание найденных документов в контекст модели вместо хранения знаний в весах.
LLM80%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.
Agents80%
Агенты · Генеративный ИИLLM, которая планирует, вызывает инструменты и итеративно движется к цели.
NDCG80%
NDCG · МетрикиНормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.
MRR80%
Средний обратный ранг · МетрикиСреднее значение 1/rank первого релевантного результата.
MAP80%
Средняя усреднённая точность · МетрикиСреднее по запросам от average precision — учитывает и релевантность, и позиции.
Precision@K80%
Точность@K · МетрикиДоля релевантных объектов среди первых K позиций выдачи.