Апостериорное распределение не сэмплируют, а приближают простым семейством: вывод превращается в задачу оптимизации.
- математическое ожидание — среднее по распределению
- значение случайной величины
- вероятность события
- распределение, предсказанное моделью
- логарифм: превращает произведения в суммы и сжимает масштаб
Ключевые тезисы
- Минимизируется от приближения к истинному апостериорному — эквивалентно максимизации ELBO.
- Масштабируется на большие данные и оптимизацию, где уже неприменим по времени.
- Плата за скорость — систематическая недооценка : VI обычно даёт слишком узкое распределение.
Подробный разбор
Вводится семейство простых распределений — например, независимые нормальные по каждой координате. Задача: подобрать так, чтобы было как можно ближе к апостериорному по . Сама KL содержит неизвестное , но её минимизация эквивалентна максимизации ELBO, которую считать можно.
- KL-дивергенция: насколько одно распределение отличается от другого
- математическое ожидание — среднее по распределению
- значение случайной величины
- вероятность события
- распределение, предсказанное моделью
- норма — длина вектора
- логарифм: превращает произведения в суммы и сжимает масштаб
| Природа метода | сэмплирование | оптимизация |
| Точность | асимптотически точен | ограничен выбранным семейством |
| Масштаб | тысячи объектов | миллионы, мини-батчами |
| Типичная ошибка | недосходимость цепи | заниженная апостериорного |
— это ровно VI, встроенный в : энкодер выдаёт параметры , а обучение максимизирует ту же ELBO — реконструкция плюс KL-штраф к приору.
Видеолекции
Тайм-кода именно на эту тему в записях нет. Но глава «Теория вероятностей и распределения» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.
Связанные темы
Байесовские вычисления
Bayesian Inference85%
Байесовский вывод · Теория вероятностей и распределенияПараметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.
MCMC85%
Марковские цепи Монте-Карло · Теория вероятностей и распределенияСэмплирование из апостериорного распределения, когда его нельзя выписать: цепь строится так, чтобы её стационарное распределение совпадало с целевым.
Maximum Likelihood85%
Метод максимального правдоподобия · Теория вероятностей и распределенияПодобрать параметры так, чтобы наблюдаемые данные были при них наиболее вероятны.
Markov Chains85%
Марковские цепи · Теория вероятностей и распределенияПроцесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.
VAE85%
Вариационный автоэнкодер · Глубокое обучениеВероятностный автоэнкодер: кодирует объект в распределение и учится генерировать из латентного пространства.
KL Divergence85%
KL-дивергенция · Математический справочникНасколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.
Глава «Теория вероятностей и распределения» последний раз правилась . Нашли ошибку — напишите.