Теория вероятностей и распределения

Variational Inference

Вариационный вывод

актуальноТекущий рабочий стандарт

Направления: Основы · Статистика, Генеративный ИИ · VAE, Продвинутый ML · Вероятностный ML

Апостериорное распределение не сэмплируют, а приближают простым семейством: вывод превращается в задачу оптимизации.

Обозначения
  • математическое ожидание — среднее по распределению
  • значение случайной величины
  • вероятность события
  • распределение, предсказанное моделью
  • логарифм: превращает произведения в суммы и сжимает масштаб
Максимизация ELBO равносильна минимизации KL(q‖p): та же величина с точностью до константы log p(x)

Ключевые тезисы

  • Минимизируется от приближения к истинному апостериорному — эквивалентно максимизации ELBO.
  • Масштабируется на большие данные и оптимизацию, где уже неприменим по времени.
  • Плата за скорость — систематическая недооценка : VI обычно даёт слишком узкое распределение.

Подробный разбор

1 подтема — объяснения, формулы, примеры и интерактивные графики.

Вводится семейство простых распределений — например, независимые нормальные по каждой координате. Задача: подобрать так, чтобы было как можно ближе к апостериорному по . Сама KL содержит неизвестное , но её минимизация эквивалентна максимизации ELBO, которую считать можно.

Обозначения
  • KL-дивергенция: насколько одно распределение отличается от другого
  • математическое ожидание — среднее по распределению
  • значение случайной величины
  • вероятность события
  • распределение, предсказанное моделью
  • норма — длина вектора
  • логарифм: превращает произведения в суммы и сжимает масштаб
Сумма постоянна, поэтому рост ELBO — это в точности падение KL до истинного апостериорного
Природа методасэмплированиеоптимизация
Точностьасимптотически точенограничен выбранным семейством
Масштабтысячи объектовмиллионы, мини-батчами
Типичная ошибканедосходимость цепизаниженная апостериорного
На практике

— это ровно VI, встроенный в : энкодер выдаёт параметры , а обучение максимизирует ту же ELBO — реконструкция плюс KL-штраф к приору.

Видеолекции

Тайм-кода именно на эту тему в записях нет. Но глава «Теория вероятностей и распределения» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.

Связанные темы

Байесовские вычисления

Bayesian Inference85%

Байесовский вывод · Теория вероятностей и распределения

Параметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.

MCMC85%

Марковские цепи Монте-Карло · Теория вероятностей и распределения

Сэмплирование из апостериорного распределения, когда его нельзя выписать: цепь строится так, чтобы её стационарное распределение совпадало с целевым.

Maximum Likelihood85%

Метод максимального правдоподобия · Теория вероятностей и распределения

Подобрать параметры так, чтобы наблюдаемые данные были при них наиболее вероятны.

Markov Chains85%

Марковские цепи · Теория вероятностей и распределения

Процесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.

VAE85%

Вариационный автоэнкодер · Глубокое обучение

Вероятностный автоэнкодер: кодирует объект в распределение и учится генерировать из латентного пространства.

KL Divergence85%

KL-дивергенция · Математический справочник

Насколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.

Кому эта тема нужна

Усиливает профиль: Исследователь.

Следующий шагДальше по связи: Bayesian InferenceПараметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.Перейти →

Глава «Теория вероятностей и распределения» последний раз правилась . Нашли ошибку — напишите.