Модель учится обращать процесс постепенного зашумления, превращая шум в изображение за серию шагов.
- шум, который мы сами добавили к чистому объекту — известный ответ
- предсказание сети: какой шум содержится в зашумлённом объекте на шаге t
Ключевые тезисы
- Прямой процесс добавляет гауссов шум, обратный — предсказывает и убирает его.
- Обучение устойчивее GAN и покрывает моды распределения лучше.
- Latent diffusion работает в сжатом пространстве, что и сделало Stable Diffusion практичной.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Прямой и обратный процессы
Разрушаем изображение шумом, учимся обращать разрушение.
- нормальное распределение со средним μ и дисперсией σ²
- коэффициент сглаживания (инерции)
- объект: вектор признаков
- число объектов в выборке
- распределение, предсказанное моделью
- коэффициент, задающий вес слагаемого или скорость обновления
- коэффициент сглаживания (инерции)
- малая константа для численной устойчивости
- объект: вектор признаков
- произведение по всем элементам
- математическое ожидание — среднее по распределению
- обучаемые параметры сети
- малая константа для численной устойчивости
- объект: вектор признаков
- функция потерь — то, что минимизируется при обучении
- норма — длина вектора
2Управление генерацией
Как заставить модель следовать текстовому запросу.
- обучаемые параметры сети
- малая константа для численной устойчивости
- объект: вектор признаков
- Большое — точнее следование промпту, но меньше разнообразия и заметные артефакты.
- Число шагов сэмплирования — компромисс качества и скорости; DDIM и другие солверы сокращают его с 1000 до 20–50.
- Latent diffusion делает всё это в сжатом пространстве VAE, что и позволило запускать модели на обычных видеокартах.
Связанные темы
Генеративные модели
VAE80%
Вариационный автоэнкодер · Глубокое обучениеВероятностный автоэнкодер: кодирует объект в распределение и учится генерировать из латентного пространства.
GAN80%
Генеративно-состязательные сети · Глубокое обучениеГенератор и дискриминатор обучаются в игре с нулевой суммой, повышая реалистичность выборок.
Generative Models80%
Генеративные модели · Генеративный ИИМодели, обучающие распределение данных и умеющие порождать новые объекты из него.
Autoregressive Models80%
Авторегрессионные модели · Генеративный ИИПорождают объект по частям, каждый раз предсказывая следующий элемент по предыдущим.
VAE80%
Вариационный автоэнкодер · Генеративный ИИГенерация через непрерывное вероятностное латентное пространство.
GAN80%
GAN · Генеративный ИИСостязательная пара сетей, дающая резкие и реалистичные изображения.
Diffusion80%
Диффузия · Генеративный ИИИтеративное расшумление — текущий стандарт генерации изображений, видео и аудио.
Density Estimation80%
Оценка плотности · Обучение без учителяВосстановление распределения данных: где объекты встречаются часто, а где почти никогда.