Изображение режется на патчи, которые обрабатываются как последовательность токенов.
Ключевые тезисы
- ViT превосходит CNN при большом объёме данных или сильном предобучении.
- Самообучение (DINO, MAE) снимает зависимость от разметки.
- Гибриды со свёртками остаются практичным компромиссом.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Изображение как последовательность патчей
Как трансформер вообще применяют к картинке.
Изображение 224×224 режется на патчи 16×16 — получается 196 «токенов». Каждый патч линейно проецируется в вектор, к нему добавляется позиционное кодирование, дальше — обычный трансформерный энкодер.
- У ViT нет свёрточного индуктивного сдвига (локальность, трансляционная инвариантность), поэтому ему нужно больше данных или сильное предобучение.
- Самообучение (DINO, MAE) снимает зависимость от разметки: MAE восстанавливает замаскированные патчи — прямой аналог BERT для изображений.
- Гибриды (свёрточный стем + трансформер) сочетают быстрое обучение и глобальный контекст.
2Самообучение для зрения
MAE и DINO — как учиться без разметки.
- MAE: маскируется 75% патчей, декодер восстанавливает их. Обучение дешёвое, поскольку энкодер видит только видимые патчи.
- DINO: самодистилляция — ученик учится совпадать с усреднённым учителем на разных аугментациях; карты внимания сами выделяют объекты.
- Обе схемы дают представления, которые затем дообучаются на небольшой размеченной выборке.
Связанные темы
Внимание и трансформеры · Мультимодальность
LLM96%
Большие языковые модели · Генеративный ИИТрансформеры-декодеры, обученные на огромных корпусах предсказывать следующий токен.
Attention85%
Механизм внимания · Глубокое обучениеКаждая позиция смотрит на все остальные и взвешивает их по релевантности — прямой доступ к контексту без рекуррентности.
Transformers85%
Трансформеры · Глубокое обучениеАрхитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.
Attention85%
Внимание в NLP · Обработка естественного языкаИзначально придумано, чтобы декодер перевода мог смотреть на нужные слова исходного предложения.
Transformers85%
Трансформеры в NLP · Обработка естественного языкаОснова всех современных языковых моделей: encoder, decoder или их комбинация.
BERT85%
BERT · Обработка естественного языкаДвунаправленный энкодер, предобученный на восстановлении замаскированных токенов.
GPT85%
GPT · Обработка естественного языкаАвторегрессионный декодер: предсказывает следующий токен, что оказалось достаточно универсальной задачей.
Transformer forecasting85%
Трансформеры для прогноза · Временные рядыВнимание над длинными горизонтами: Informer, Autoformer, PatchTST, TFT.
Multimodal Models75%
Мультимодальные модели · Компьютерное зрениеЕдиное пространство для изображений и текста — основа поиска по описанию и визуальных ассистентов.
Multimodal Models75%
Мультимодальные модели · Генеративный ИИЕдиная модель, принимающая и порождающая несколько модальностей: текст, изображения, звук.
OCR75%
Оптическое распознавание текста · Компьютерное зрениеИзвлечение текста из изображений и сканов: детекция областей текста и его распознавание.
Embeddings75%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.