Трансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.
Ключевые тезисы
- Законы масштабирования связывают параметры, данные и качество.
- Ключевые ограничения: длина контекста, галлюцинации, дата обучения.
- Инференс упирается в память и пропускную способность, а не только во FLOPs.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Законы масштабирования
Как связаны параметры, данные и качество.
- коэффициент, задающий вес слагаемого или скорость обновления
- коэффициент сглаживания (инерции)
- число объектов в выборке
- матрица преобразования
- функция потерь — то, что минимизируется при обучении
Работа Chinchilla показала, что многие модели были недообучены: при фиксированном бюджете выгоднее модель поменьше, обученная на большем числе токенов. Ориентир — примерно 20 токенов на параметр.
2Экономика инференса
Почему генерация дороже, чем чтение промпта.
- Prefill (обработка промпта) параллелится по токенам и упирается в вычисления.
- Decode (генерация) последователен и упирается в пропускную способность памяти: на каждый токен читаются все веса.
- KV-кэш растёт линейно с длиной контекста и занимает существенную часть памяти.
- Отсюда приёмы: квантизация (int8/int4), батчинг запросов, спекулятивное декодирование, PagedAttention.
Связанные темы
Внимание и трансформеры · Поиск, эмбеддинги и RAG · Мультимодальность
Vision Transformers96%
Vision Transformers · Компьютерное зрениеИзображение режется на патчи, которые обрабатываются как последовательность токенов.
Embeddings95%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
Attention85%
Механизм внимания · Глубокое обучениеКаждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.
Transformers85%
Трансформеры · Глубокое обучениеАрхитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.
Attention85%
Внимание в NLP · Обработка естественного языкаИзначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.
Transformers85%
Трансформеры в NLP · Обработка естественного языкаОснова всех современных языковых моделей: encoder, decoder или их комбинация.
BERT85%
BERT · Обработка естественного языкаДвунаправленный энкодер, предобученный на восстановлении замаскированных токенов.
GPT85%
GPT · Обработка естественного языкаАвторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.
Transformer forecasting85%
Трансформеры для прогноза · Временные рядыВнимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.
Semantic Search80%
Семантический поиск · Обработка естественного языкаПоиск по смыслу, а не по совпадению слов: запрос и документы сравниваются в пространстве эмбеддингов.
RAG80%
Retrieval-Augmented Generation · Обработка естественного языкаЯзыковая модель отвечает, опираясь на найденные во внешней базе фрагменты, а не только на память весов.
TF-IDF80%
TF-IDF · Обработка естественного языкаВзвешивает частоту слова в документе на его редкость в корпусе, подавляя общеупотребительные слова.
RAG80%
RAG · Генеративный ИИПодмешивание найденных документов в контекст модели вместо хранения знаний в весах.
Agents80%
Агенты · Генеративный ИИLLM, которая планирует, вызывает инструменты и итеративно движется к цели.
NDCG80%
NDCG · МетрикиНормированный дисконтированный кумулятивный выигрыш: учитывает градации релевантности и позиции с логарифмическим дисконтом.
MRR80%
Средний обратный ранг · МетрикиСреднее значение 1/rank первого релевантного результата.
MAP80%
Средняя усреднённая точность · МетрикиСреднее по запросам от average precision — учитывает и релевантность, и позиции.
Precision@K80%
Точность@K · МетрикиДоля релевантных объектов среди первых K позиций выдачи.
Recall@K80%
Полнота@K · МетрикиКакая доля всех релевантных объектов попала в топ-K.
Multimodal Models75%
Мультимодальные модели · Компьютерное зрениеЕдиное пространство для изображений и текста — основа поиска по описанию и визуальных ассистентов.
Multimodal Models75%
Мультимодальные модели · Генеративный ИИЕдиная модель, принимающая и порождающая несколько модальностей: текст, изображения, звук.
OCR75%
Оптическое распознавание текста · Компьютерное зрениеИзвлечение текста из изображений и сканов: детекция областей текста и его распознавание.