Генеративный ИИ

Multimodal Models

Мультимодальные модели

новинкаНовое или быстро растущее направление

Единая модель, принимающая и порождающая несколько модальностей: текст, изображения, звук.

Ключевые тезисы

  • Обычно это зрительный энкодер, спроецированный в пространство токенов LLM.
  • Позволяют решать задачи по документам, схемам и скриншотам.
  • Разметка мультимодальных данных — главный узкий ресурс.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Как устроены VLM

Зрительный энкодер плюс проектор плюс языковая модель.

  1. Изображение проходит через зрительный энкодер (обычно CLIP ViT).
  2. Проектор (linear или MLP) переводит зрительные признаки в пространство токенов LLM.
  3. Эти «зрительные токены» подставляются в контекст вместе с текстом.
  4. Дальше — обычная авторегрессионная генерация.
На практике

Обучение обычно двухэтапное: сначала выравнивание проектора при замороженных энкодере и LLM, затем инструктивное дообучение на диалогах об изображениях.

2

Ограничения VLM

Где они систематически ошибаются.

  • Точный подсчёт объектов («сколько здесь стульев») — слабое место почти всех моделей.
  • Мелкий текст и таблицы: лучше отдельный OCR и парсер структуры.
  • Пространственные отношения («левее чем») распознаются неуверенно.
  • Галлюцинации деталей, которых нет на изображении, — типичны при наводящем вопросе.

Связанные темы

Мультимодальность