Обработка естественного языка

RAG

Retrieval-Augmented Generation

новинкаНовое или быстро растущее направление

Языковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.

Ключевые тезисы

  • Даёт свежие данные и ссылки на источники, снижая галлюцинации.
  • Качество RAG определяется в первую очередь качеством retrieval.
  • Ключевые ручки: стратегия чанкования, реранкинг, размер контекста.
Тема также относится к главам:Генеративный ИИПриложения

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Устройство RAG-пайплайна

Пять этапов, каждый из которых может всё испортить.

  1. Чанкование: разбить документы на фрагменты (обычно 200–500 токенов с перекрытием).
  2. Индексация: посчитать эмбеддинги и построить индекс, обычно вместе с BM25.
  3. Retrieval: найти топ-k фрагментов по запросу.
  4. Реранкинг: отсортировать их cross-encoder'ом.
  5. Генерация: подать фрагменты в промпт с требованием отвечать только по ним и давать ссылки.
На практике

Качество RAG почти целиком определяется retrieval. Если нужного фрагмента нет в контексте, никакая модель не придумает правильный ответ — она его сгаллюцинирует.

2

Как оценивать RAG

Отдельно поиск, отдельно ответ.

Что измеряемМетрика
Нашёлся ли нужный фрагментRecall@k, MRR
Насколько ответ опирается на источникиfaithfulness / groundedness
Отвечает ли он на вопросanswer relevance, exact match
Нет ли лишнего в контекстеcontext precision

Практический минимум: собрать 50–100 реальных вопросов с эталонными фрагментами и мерить Recall@k при каждом изменении чанкования или модели эмбеддингов. Это дешевле и информативнее, чем оценивать финальные ответы вручную.

Связанные темы

Поиск, эмбеддинги и RAG

Embeddings80%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

Semantic Search80%

Семантический поиск · Обработка естественного языка

Поиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.

TF-IDF80%

TF-IDF · Обработка естественного языка

Взвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.

RAG80%

RAG · Генеративный ИИ

Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.

LLM80%

Большие языковые модели · Генеративный ИИ

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Agents80%

Агенты · Генеративный ИИ

LLM, которая планирует, вызывает инструменты и итеративно движется к цели.

NDCG80%

NDCG · Метрики

Нормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.

MRR80%

Средний обратный ранг · Метрики

Среднее значение 1/rank первого релевантного результата.

MAP80%

Средняя усреднённая точность · Метрики

Среднее по запросам от average precision — учитывает и релевантность, и позиции.

Precision@K80%

Точность@K · Метрики

Доля релевантных объектов среди первых K позиций выдачи.

Recall@K80%

Полнота@K · Метрики

Какая доля всех релевантных объектов попала в топ-K.