К качеству каждого кадра добавляется временная согласованность: объекты не должны мерцать и менять форму между кадрами.
Ключевые тезисы
- Ключевое отличие от изображений — temporal coherence: и распространяются и вдоль оси времени.
- Стоимость растёт кратно длине ролика, поэтому работают в латентном пространстве и генерируют ключевые кадры с последующей интерполяцией.
- Метрики покадрового качества (FID) ничего не говорят о дрожании — нужны FVD и просмотр человеком.
Подробный разбор
Если генерировать каждый кадр независимо, каждый по отдельности может быть отличным, а ролик — непригодным: фон мерцает, одежда меняет цвет, объект дрожит и «плывёт». Поэтому модель работает не с кадром, а с блоком кадров, и распространяется вдоль оси времени (temporal attention), а становятся трёхмерными.
- Стоимость растёт кратно длине: отсюда генерация в латентном пространстве и разделение на ключевые кадры + интерполяцию.
- Длинные ролики собирают окнами с перекрытием и переносом состояния, иначе согласованность теряется на границах.
- Управление добавляют траекторией камеры, картой глубины или начальным кадром (image-to-video).
- Оценка: FVD вместо FID, но решает всё равно просмотр человеком — дрожание метрики почти не ловят.
Постоянство объекта на протяжении ролика (identity consistency) — отдельная нерешённая задача: лицо героя к концу сцены заметно «уезжает», и это видно людям, но не автоматическим метрикам.
Видеолекции
Тайм-кода именно на эту тему в записях нет. Но глава «Генеративный ИИ» разобрана в курсах целиком — с той оговоркой, что место в записи придётся искать самому.
Связанные темы
Качество генерации · Управляемая генерация
FID and Generation Quality80%
FID и качество генерации · МетрикиМетрики визуальной генерации: расстояние между распределениями признаков реальных и сгенерированных изображений.
Text Generation Metrics80%
Метрики генерации текста · МетрикиBLEU, ROUGE и BERTScore: от совпадения n-грамм до сравнения смыслов через контекстные эмбеддинги.
Perplexity80%
Перплексия · МетрикиЭкспонента кросс-энтропии языковой модели: между сколькими равновероятными вариантами она в среднем выбирает.
LLM Evaluation80%
Оценка языковых моделей · Генеративный ИИКак измерять качество генерации: бенчмарки, оценка моделью-судьёй и человеческие сравнения.
Cohen's Kappa80%
Каппа Коэна · МетрикиСогласие двух разметчиков или модели с разметкой с поправкой на случайные совпадения.
Latent Diffusion80%
Латентная диффузия · Генеративный ИИДиффузия не в пикселях, а в сжатом пространстве автоэнкодера: та же модель на порядок дешевле.
ControlNet80%
Управляемая генерация · Генеративный ИИДополнительная сеть, которая задаёт генерации пространственную структуру: эскиз, позу, карту глубины, границы.
Diffusion Sampling80%
Сэмплеры диффузии · Генеративный ИИЧисло шагов денойзинга — главный рычаг скорости; решает его не переобучение, а более точный численный метод.
Diffusion80%
Диффузия · Генеративный ИИИтеративное расшумление — текущий стандарт генерации изображений, видео и аудио.
Structured Output80%
Структурированный вывод · Генеративный ИИКак получить от языковой модели JSON, который распарсится с первого раза, а не текст с комментариями вокруг.
Prompting80%
Промптинг · Генеративный ИИУправление поведением модели через формулировку запроса, без изменения весов.
Глава «Генеративный ИИ» последний раз правилась . Нашли ошибку — напишите.