Метрики

FID and Generation Quality

FID и качество генерации

актуальноТекущий рабочий стандарт

Направления: Генеративный ИИ · GAN

Метрики визуальной генерации: расстояние между распределениями реальных и сгенерированных изображений.

Обозначения
  • среднее значение
  • награда, полученная агентом на шаге
  • норма — длина вектора
Расстояние Фреше между двумя гауссианами, подогнанными к признакам реальных (r) и сгенерированных (g) изображений

Ключевые тезисы

  • FID сравнивает средние и Inception: чем меньше, тем ближе генерации к реальным данным.
  • CLIPScore измеряет соответствие изображения тексту запроса, но ничего не говорит о реализме.
  • Автоматические метрики плохо ловят артефакты и «», поэтому релиз всегда сопровождают экспертной оценкой.

Подробный разбор

1 подтема — объяснения, формулы, примеры и интерактивные графики.

Обозначения
  • среднее значение
  • награда, полученная агентом на шаге
  • норма — длина вектора
берутся из предобученной Inception; сравниваются средние и двух наборов
  • FID зависит от размера выборки и от конкретной реализации — числа из разных статей несопоставимы напрямую.
  • FID ничего не знает о том, соответствует ли картинка запросу; это измеряет CLIPScore.
  • Ни та, ни другая метрика не ловит анатомические ошибки, кривой текст на вывеске и артефакты на границах.
  • Для видео добавляется FVD, но и он не отражает дрожание, заметное человеку.

Отсюда стандартная практика релиза: автоматические метрики отслеживают регрессии между версиями, а решение о выкате принимается по слепому сравнению людьми — попарные предпочтения (A/B side-by-side) на фиксированном наборе запросов.

На практике

Экспертная оценка тоже требует дисциплины: одинаковые инструкции, слепое предъявление, несколько оценщиков и подсчёт согласия (каппа Коэна). Иначе она измеряет мнение одного человека в конкретный день.

Тема также относится к главам:Генеративный ИИОценка

Связанные темы

Качество генерации

Следующий шагДальше по связи: Text Generation MetricsBLEU, ROUGE и BERTScore: от совпадения n-грамм до сравнения смыслов через контекстные эмбеддинги.Перейти →

Глава «Метрики» последний раз правилась . Нашли ошибку — напишите.