Единая модель, принимающая и порождающая несколько модальностей: текст, изображения, звук.
Ключевые тезисы
- Обычно это зрительный энкодер, спроецированный в пространство токенов LLM.
- Позволяют решать задачи по документам, схемам и скриншотам.
- Разметка мультимодальных данных — главный узкий ресурс.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Как устроены VLM
Зрительный энкодер плюс проектор плюс языковая модель.
- Изображение проходит через зрительный энкодер (обычно CLIP ViT).
- Проектор (linear или MLP) переводит зрительные признаки в пространство токенов LLM.
- Эти «зрительные токены» подставляются в контекст вместе с текстом.
- Дальше — обычная авторегрессионная генерация.
Обучение обычно двухэтапное: сначала выравнивание проектора при замороженных энкодере и LLM, затем инструктивное дообучение на диалогах об изображениях.
2Ограничения VLM
Где они систематически ошибаются.
- Точный подсчёт объектов («сколько здесь стульев») — слабое место почти всех моделей.
- Мелкий текст и таблицы: лучше отдельный OCR и парсер структуры.
- Пространственные отношения («левее чем») распознаются неуверенно.
- Галлюцинации деталей, которых нет на изображении, — типичны при наводящем вопросе.
Связанные темы
Мультимодальность
Multimodal Models75%
Мультимодальные модели · Компьютерное зрениеЕдиное пространство для изображений и текста — основа поиска по описанию и визуальных ассистентов.
Vision Transformers75%
Vision Transformers · Компьютерное зрениеИзображение режется на патчи, которые обрабатываются как последовательность токенов.
OCR75%
Оптическое распознавание текста · Компьютерное зрениеИзвлечение текста из изображений и сканов: детекция областей текста и его распознавание.
Embeddings75%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
LLM75%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.