Генеративный ИИ

Latent Diffusion

Латентная диффузия

новинкаНовое или быстро растущее направление

Направления: Генеративный ИИ · Диффузия

не в пикселях, а в сжатом пространстве : та же модель на порядок дешевле.

Ключевые тезисы

  • сжимает изображение в 8 раз по каждой стороне — площадь, на которой работает U-Net, падает в 64 раза.
  • Семантика при этом сохраняется, а отбрасывается высокочастотная детализация, которую декодер восстанавливает обратно.
  • Именно это сделало Stable Diffusion запускаемым на пользовательской видеокарте, а не только в дата-центре.

Подробный разбор

1 подтема — объяснения, формулы, примеры и интерактивные графики.

Пиксельная выполняет десятки шагов U-Net прямо на изображении. Латентная сначала сжимает картинку () с коэффициентом 8 по каждой стороне: 512×512×3 превращается в 64×64×4. Диффузия идёт в этом пространстве, а декодер возвращает результат в пиксели.

Пиксельная Латентная
Пространство512 × 512 × 364 × 64 × 4
Элементов на шаг≈ 786 000≈ 16 400
Стоимость шагавысокаяпримерно в 50 раз ниже
Где запускаетсякластерпользовательская
  • обучается отдельно и один раз: он отбрасывает высокочастотную детализацию, сохраняя семантику.
  • работает там, где «живёт смысл», и не тратит мощность на текстур — это задача декодера.
  • Текстовое условие подмешивается cross-attention в блоки U-Net, поэтому один и тот же приём работает для текста, разметки и других условий.
На практике

Плата за сжатие — потолок детализации: не восстановит то, что выбросил. Отсюда типичные проблемы с мелким текстом и лицами на дальнем плане и отдельная стадия upscale в продовых пайплайнах.

Видеолекции

Записи университетских курсов, где эта тема звучит. Тайм-кодов у них нет, поэтому открываются они с начала.

Связанные темы

Управляемая генерация

ControlNet80%

Управляемая генерация · Генеративный ИИ

Дополнительная сеть, которая задаёт генерации пространственную структуру: эскиз, позу, карту глубины, границы.

Diffusion Sampling80%

Сэмплеры диффузии · Генеративный ИИ

Число шагов денойзинга — главный рычаг скорости; решает его не переобучение, а более точный численный метод.

Video Generation80%

Генерация видео · Генеративный ИИ

К качеству каждого кадра добавляется временная согласованность: объекты не должны мерцать и менять форму между кадрами.

Diffusion80%

Диффузия · Генеративный ИИ

Итеративное расшумление — текущий стандарт генерации изображений, видео и аудио.

Structured Output80%

Структурированный вывод · Генеративный ИИ

Как получить от языковой модели JSON, который распарсится с первого раза, а не текст с комментариями вокруг.

Prompting80%

Промптинг · Генеративный ИИ

Управление поведением модели через формулировку запроса, без изменения весов.

Кому эта тема нужна

Профильная компетенция для роли: CV-инженер.

Следующий шагДальше по связи: ControlNetДополнительная сеть, которая задаёт генерации пространственную структуру: эскиз, позу, карту глубины, границы.Перейти →

Глава «Генеративный ИИ» последний раз правилась . Нашли ошибку — напишите.