Генеративный ИИ

ControlNet

Управляемая генерация

новинкаНовое или быстро растущее направление

Направления: Прикладные направления · Мультимодальный ИИ, Генеративный ИИ · Диффузия

Дополнительная сеть, которая задаёт генерации пространственную структуру: эскиз, позу, карту глубины, границы.

Ключевые тезисы

  • Копия энкодера диффузионной модели обучается на условии, а базовые веса остаются замороженными.
  • Соединения через zero-convolution: в начале обучения управляющая ветка не влияет на результат и не ломает базовую модель.
  • Одна базовая модель + набор ControlNet-ов покрывает разные типы условий без основной сети.

Подробный разбор

1 подтема — объяснения, формулы, примеры и интерактивные графики.

  1. Веса энкодера диффузионной U-Net копируются; оригинал замораживается.
  2. Копия получает на вход управляющую карту: контуры Canny, карту глубины, скелет позы, , эскиз.
  3. Выходы копии складываются с признаками базовой сети через zero-convolution — , инициализированные нулями.
  4. В начале обучения вклад управляющей ветки равен нулю, поэтому базовая модель не деградирует ни на первом шаге, ни при малом датасете.
УсловиеЧто задаёт
Canny / scribbleконтуры и композицию
Depthобъёмную структуру сцены
OpenPoseпозу человека
Segmentationрасположение объектов по классам
На практике

отвечает за содержание и стиль, ControlNet — за геометрию. Их и разделяют: одна базовая модель плюс набор управляющих сетей покрывает разные типы условий без основной модели.

Видеолекции

Тайм-кода именно на эту тему в записях нет. Но глава «Генеративный ИИ» разобрана в курсах целиком — с той оговоркой, что место в записи придётся искать самому.

Связанные темы

Управляемая генерация

Latent Diffusion80%

Латентная диффузия · Генеративный ИИ

Диффузия не в пикселях, а в сжатом пространстве автоэнкодера: та же модель на порядок дешевле.

Diffusion Sampling80%

Сэмплеры диффузии · Генеративный ИИ

Число шагов денойзинга — главный рычаг скорости; решает его не переобучение, а более точный численный метод.

Video Generation80%

Генерация видео · Генеративный ИИ

К качеству каждого кадра добавляется временная согласованность: объекты не должны мерцать и менять форму между кадрами.

Diffusion80%

Диффузия · Генеративный ИИ

Итеративное расшумление — текущий стандарт генерации изображений, видео и аудио.

Structured Output80%

Структурированный вывод · Генеративный ИИ

Как получить от языковой модели JSON, который распарсится с первого раза, а не текст с комментариями вокруг.

Prompting80%

Промптинг · Генеративный ИИ

Управление поведением модели через формулировку запроса, без изменения весов.

Следующий шагДальше по связи: Latent DiffusionДиффузия не в пикселях, а в сжатом пространстве автоэнкодера: та же модель на порядок дешевле.Перейти →

Глава «Генеративный ИИ» последний раз правилась . Нашли ошибку — напишите.