Обработка естественного языка

Embeddings

Эмбеддинги

актуальноТекущий рабочий стандарт

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

Ключевые тезисы

  • Контекстные эмбеддинги (BERT, E5) зависят от окружения слова, статические — нет.
  • Косинусная близость — стандартная мера сравнения.
  • Векторные БД (FAISS, pgvector, Qdrant) обеспечивают поиск по миллионам векторов.
Тема также относится к главам:Графы и сетиМашинное обучение на графах

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Статические и контекстные

Одно слово — один вектор или разные векторы в разных предложениях.

СтатическиеКонтекстные
ПримерыWord2Vec, GloVe, FastTextBERT, E5, GTE
Омонимияне различает: «замок» один векторразличает по контексту
Скоростьпросто таблица поисканужен прямой проход модели
Применениелёгкие модели, признакипоиск, RAG, классификация

Для поиска обычно используют модели, специально обученные на парах «запрос — релевантный документ»: их пространство устроено так, что косинусная близость соответствует релевантности, а не просто тематической похожести.

Связанные темы

Прикладные задачи NLP · Представления и снижение размерности · Поиск, эмбеддинги и RAG · От слов к векторам · Мультимодальность

TF-IDF95%

TF-IDF · Обработка естественного языка

Взвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.

LLM95%

Большие языковые модели · Генеративный ИИ

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Semantic Search80%

Семантический поиск · Обработка естественного языка

Поиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.

RAG80%

Retrieval-Augmented Generation · Обработка естественного языка

Языковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.

RAG80%

RAG · Генеративный ИИ

Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.

Agents80%

Агенты · Генеративный ИИ

LLM, которая планирует, вызывает инструменты и итеративно движется к цели.

NDCG80%

NDCG · Метрики

Нормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.

MRR80%

Средний обратный ранг · Метрики

Среднее значение 1/rank первого релевантного результата.

MAP80%

Средняя усреднённая точность · Метрики

Среднее по запросам от average precision — учитывает и релевантность, и позиции.

Precision@K80%

Точность@K · Метрики

Доля релевантных объектов среди первых K позиций выдачи.

Recall@K80%

Полнота@K · Метрики

Какая доля всех релевантных объектов попала в топ-K.

Text classification75%

Классификация текстов · Обработка естественного языка

Отнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.

NER75%

Извлечение именованных сущностей · Обработка естественного языка

Разметка последовательности: находим в тексте имена, организации, даты, суммы.

Sentiment Analysis75%

Анализ тональности · Обработка естественного языка

Определение эмоциональной окраски текста — от бинарной оценки до аспектной тональности.

BERT75%

BERT · Обработка естественного языка

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

F175%

F1-мера · Метрики

Гармоническое среднее точности и полноты — компромисс между ними одним числом.

Precision75%

Точность · Метрики

Какая доля объектов, предсказанных положительными, действительно положительна.

Recall75%

Полнота · Метрики

Какая доля реально положительных объектов найдена моделью.

Tokenization75%

Токенизация · Обработка естественного языка

Разбиение текста на единицы, с которыми работает модель: слова, подслова или байты.

Bag of Words75%

Мешок слов · Обработка естественного языка

Текст представляется вектором частот слов, порядок полностью игнорируется.

Word2Vec75%

Word2Vec · Обработка естественного языка

Обучает плотные векторы слов по контексту: близкие по смыслу слова оказываются рядом в пространстве.

GloVe75%

GloVe · Обработка естественного языка

Строит эмбеддинги из глобальной матрицы совстречаемости слов, а не только из локальных окон.

FastText75%

FastText · Обработка естественного языка

Представляет слово суммой векторов его символьных n-грамм, что даёт эмбеддинги даже для незнакомых слов.

Multimodal Models75%

Мультимодальные модели · Компьютерное зрение

Единое пространство для изображений и текста — основа поиска по описанию и визуальных ассистентов.

Multimodal Models75%

Мультимодальные модели · Генеративный ИИ

Единая модель, принимающая и порождающая несколько модальностей: текст, изображения, звук.

Vision Transformers75%

Vision Transformers · Компьютерное зрение

Изображение режется на патчи, которые обрабатываются как последовательность токенов.

OCR75%

Оптическое распознавание текста · Компьютерное зрение

Извлечение текста из изображений и сканов: детекция областей текста и его распознавание.

PCA70%

Метод главных компонент · Классическое машинное обучение

Ортогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.

Dimensionality reduction70%

Снижение размерности · Данные

Проекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.

Dimensionality Reduction70%

Снижение размерности · Обучение без учителя

Компактное представление данных, сохраняющее важную часть структуры.

Representation Learning70%

Обучение представлений · Обучение без учителя

Модель сама учится полезным признакам, чаще всего через self-supervised задачи.

Autoencoders70%

Автоэнкодеры · Глубокое обучение

Сеть учится восстанавливать вход через узкое место, получая сжатое представление.

Eigenvalue70%

Собственное значение · Математический справочник

Коэффициент растяжения вдоль направления, которое преобразование не поворачивает.

Eigenvector70%

Собственный вектор · Математический справочник

Направление, сохраняющееся при линейном преобразовании с точностью до масштаба.