не в пикселях, а в сжатом пространстве : та же модель на порядок дешевле.
Ключевые тезисы
- сжимает изображение в 8 раз по каждой стороне — площадь, на которой работает U-Net, падает в 64 раза.
- Семантика при этом сохраняется, а отбрасывается высокочастотная детализация, которую декодер восстанавливает обратно.
- Именно это сделало Stable Diffusion запускаемым на пользовательской видеокарте, а не только в дата-центре.
Подробный разбор
Пиксельная выполняет десятки шагов U-Net прямо на изображении. Латентная сначала сжимает картинку () с коэффициентом 8 по каждой стороне: 512×512×3 превращается в 64×64×4. Диффузия идёт в этом пространстве, а декодер возвращает результат в пиксели.
| Пиксельная | Латентная | |
|---|---|---|
| Пространство | 512 × 512 × 3 | 64 × 64 × 4 |
| Элементов на шаг | ≈ 786 000 | ≈ 16 400 |
| Стоимость шага | высокая | примерно в 50 раз ниже |
| Где запускается | кластер | пользовательская |
- обучается отдельно и один раз: он отбрасывает высокочастотную детализацию, сохраняя семантику.
- работает там, где «живёт смысл», и не тратит мощность на текстур — это задача декодера.
- Текстовое условие подмешивается cross-attention в блоки U-Net, поэтому один и тот же приём работает для текста, разметки и других условий.
Плата за сжатие — потолок детализации: не восстановит то, что выбросил. Отсюда типичные проблемы с мелким текстом и лицами на дальнем плане и отдельная стадия upscale в продовых пайплайнах.
Видеолекции
Записи университетских курсов, где эта тема звучит. Тайм-кодов у них нет, поэтому открываются они с начала.
Связанные темы
Управляемая генерация
ControlNet80%
Управляемая генерация · Генеративный ИИДополнительная сеть, которая задаёт генерации пространственную структуру: эскиз, позу, карту глубины, границы.
Diffusion Sampling80%
Сэмплеры диффузии · Генеративный ИИЧисло шагов денойзинга — главный рычаг скорости; решает его не переобучение, а более точный численный метод.
Video Generation80%
Генерация видео · Генеративный ИИК качеству каждого кадра добавляется временная согласованность: объекты не должны мерцать и менять форму между кадрами.
Diffusion80%
Диффузия · Генеративный ИИИтеративное расшумление — текущий стандарт генерации изображений, видео и аудио.
Structured Output80%
Структурированный вывод · Генеративный ИИКак получить от языковой модели JSON, который распарсится с первого раза, а не текст с комментариями вокруг.
Prompting80%
Промптинг · Генеративный ИИУправление поведением модели через формулировку запроса, без изменения весов.
Глава «Генеративный ИИ» последний раз правилась . Нашли ошибку — напишите.