NLP
Обработка естественного языка
Как текст превращается в числа, а числа — в смысл. Глава прослеживает путь от частотных методов до больших языковых моделей и поиска по смыслу.
Tokenizationактуально
ТокенизацияРазбиение текста на единицы, с которыми работает модель: слова, подслова или байты.
TF-IDFактуально
TF-IDFВзвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.
Embeddingsактуально
ЭмбеддингиПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
Bag of Wordsклассика
Мешок словТекст представляется вектором частот слов, порядок полностью игнорируется.
Word2Vecклассика
Word2VecОбучает плотные векторы слов по контексту: близкие по смыслу слова оказываются рядом в пространстве.
GloVeклассика
GloVeСтроит эмбеддинги из глобальной матрицы совстречаемости слов, а не только из локальных окон.
FastTextклассика
FastTextПредставляет слово суммой векторов его символьных n-грамм, что даёт эмбеддинги даже для незнакомых слов.
Attentionактуально
Внимание в NLPИзначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.
Transformersактуально
Трансформеры в NLPОснова всех современных языковых моделей: encoder, decoder или их комбинация.
BERTактуально
BERTДвунаправленный энкодер, предобученный на восстановлении замаскированных токенов.
GPTактуально
GPTАвторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.
RNN/LSTM for NLPклассика
RNN/LSTM в NLPПервое поколение нейросетевых моделей языка: последовательная обработка токенов со скрытым состоянием.
Sequence-to-Sequenceклассика
Seq2SeqСхема «энкодер сжимает вход — декодер порождает выход» для перевода, суммаризации и диалога.
LLMновинка
Большие языковые моделииз «Генеративный ИИ»Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.
Attentionактуально
Механизм вниманияиз «Глубокое обучение»Каждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.
Transformersактуально
Трансформерыиз «Глубокое обучение»Архитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.
Text classificationактуально
Классификация текстовОтнесение документа к одной или нескольким категориям: от спам-фильтра до маршрутизации тикетов.
NERактуально
Извлечение именованных сущностейРазметка последовательности: находим в тексте имена, организации, даты, суммы.
Sentiment Analysisактуально
Анализ тональностиОпределение эмоциональной окраски текста — от бинарной оценки до аспектной тональности.
Summarizationактуально
СуммаризацияСжатие текста с сохранением смысла: извлекающая (выбор предложений) и абстрактивная (генерация).
Topic Modelingклассика
Тематическое моделированиеАвтоматическое выделение тем в коллекции документов: от классического LDA до кластеризации эмбеддингов.
Semantic Searchновинка
Семантический поискПоиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.
RAGновинка
Retrieval-Augmented GenerationЯзыковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.
RAGновинка
RAGиз «Генеративный ИИ»Подмешивание найденных документов в контекст модели вместо хранения знаний в весах.
NDCGактуально
NDCGиз «Метрики»Нормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.
Promptingновинка
Промптингиз «Генеративный ИИ»Управление поведением модели через формулировку запроса, без изменения весов.
LLM Evaluationновинка
Оценка языковых моделейиз «Генеративный ИИ»Как измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.
Fine-tuningактуально
Дообучениеиз «Генеративный ИИ»Адаптация предобученной модели под домен или формат на собственных данных.
Perplexityактуально
Перплексияиз «Метрики»Экспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.
9 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.