Раздел 05

NLP

Обработка естественного языка

Как текст превращается в числа, а числа — в смысл. Глава прослеживает путь от частотных методов до больших языковых моделей и поиска по смыслу.

2 новинок11 актуальных7 классикаDS-направление
новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

Tokenizationактуально

Токенизация

Разбиение текста на единицы, с которыми работает модель: слова, подслова или байты.

TF-IDFактуально

TF-IDF

Взвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.

Embeddingsактуально

Эмбеддинги

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

Bag of Wordsклассика

Мешок слов

Текст представляется вектором частот слов, порядок полностью игнорируется.

Word2Vecклассика

Word2Vec

Обучает плотные векторы слов по контексту: близкие по смыслу слова оказываются рядом в пространстве.

GloVeклассика

GloVe

Строит эмбеддинги из глобальной матрицы совстречаемости слов, а не только из локальных окон.

FastTextклассика

FastText

Представляет слово суммой векторов его символьных n-грамм, что даёт эмбеддинги даже для незнакомых слов.

Attentionактуально

Внимание в NLP

Изначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.

Transformersактуально

Трансформеры в NLP

Основа всех современных языковых моделей: encoder, decoder или их комбинация.

BERTактуально

BERT

Двунаправленный энкодер, предобученный на восстановлении замаскированных токенов.

GPTактуально

GPT

Авторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.

RNN/LSTM for NLPклассика

RNN/LSTM в NLP

Первое поколение нейросетевых моделей языка: последовательная обработка токенов со скрытым состоянием.

Sequence-to-Sequenceклассика

Seq2Seq

Схема «энкодер сжимает вход — декодер порождает выход» для перевода, суммаризации и диалога.

LLMновинка

Большие языковые моделииз «Генеративный ИИ»

Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.

Attentionактуально

Механизм вниманияиз «Глубокое обучение»

Каждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.

Transformersактуально

Трансформерыиз «Глубокое обучение»

Архитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.

Text classificationактуально

Классификация текстов

Отнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.

NERактуально

Извлечение именованных сущностей

Разметка последовательности: находим в тексте имена, организации, даты, суммы.

Sentiment Analysisактуально

Анализ тональности

Определение эмоциональной окраски текста — от бинарной оценки до аспектной тональности.

Summarizationактуально

Суммаризация

Сжатие текста с сохранением смысла: извлекающая (выбор предложений) и абстрактивная (генерация).

Topic Modelingклассика

Тематическое моделирование

Автоматическое выделение тем в коллекции документов: от классического LDA до кластеризации эмбеддингов.

Semantic Searchновинка

Семантический поиск

Поиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.

RAGновинка

Retrieval-Augmented Generation

Языковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.

RAGновинка

RAGиз «Генеративный ИИ»

Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.

NDCGактуально

NDCGиз «Метрики»

Нормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.

Promptingновинка

Промптингиз «Генеративный ИИ»

Управление поведением модели через формулировку запроса, без изменения весов.

LLM Evaluationновинка

Оценка языковых моделейиз «Генеративный ИИ»

Как измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.

Fine-tuningактуально

Дообучениеиз «Генеративный ИИ»

Адаптация предобученной модели под домен или формат на собственных данных.

Perplexityактуально

Перплексияиз «Метрики»

Экспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.

9 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.