Сэмплирование из апостериорного распределения, когда его нельзя выписать: цепь строится так, чтобы её стационарное распределение совпадало с целевым.
- параметры модели
- показатель степенного закона: чем он меньше, тем тяжелее хвост
- вероятность события
- распределение, предсказанное моделью
Ключевые тезисы
- Метрополис — Гастингс предлагает шаг и принимает его с вероятностью, зависящей от отношения плотностей.
- Сэмплирование Гиббса — частный случай: каждая координата обновляется из своего полного условного распределения, и предложение всегда принимается.
- Диагностика обязательна: burn-in, несколько цепей, и эффективный размер выборки.
Подробный разбор
Апостериорное распределение известно с точностью до нормировочной константы: . Интеграл в знаменателе не берётся, но для сэмплирования он и не нужен — в правило принятия входит только отношение плотностей, в котором константа сокращается.
| Метрополис — Гастингс | Сэмплирование Гиббса | |
|---|---|---|
| Предложение | произвольное распределение | полное условное |
| Принятие шага | с вероятностью | всегда, |
| Что требуется | уметь считать плотность с точностью до константы | уметь сэмплировать из условных распределений |
| Настройка | ширина шага: и слишком узкий, и слишком широкий плохи | настраивать нечего |
- Гиббс обновляет координаты по : , затем и так далее.
- Каждое такое обновление — шаг M–H, у которого предложение совпадает с целевым условным распределением, поэтому отношение в равно единице.
- Отсюда и ограничение: Гиббс применим, только когда из полных условных распределений можно сэмплировать напрямую — обычно в сопряжённых моделях.
Сильная параметров — беда Гиббса: координатные шаги двигаются вдоль осей и по вытянутому «оврагу» цепь ползёт очень медленно. В таких моделях берут HMC/NUTS, который использует плотности (Stan, PyMC, NumPyro).
- Burn-in: первые сотни-тысячи сэмплов отбрасываются — цепь ещё идёт от случайной стартовой точки.
- Несколько цепей из разных стартов: если они сошлись к разным областям, результат непригоден.
- $\hat R$ (Gelman — Rubin): сравнивает разброс внутри цепи и между цепями; значение выше 1.01 — тревога.
- ESS (effective sample size): сколько независимых сэмплов эквивалентны полученным; из-за обычно в разы меньше длины цепи.
даёт точный ответ в пределе бесконечного времени, — приближённый, но быстро. Выбор между ними — это выбор между точностью и масштабом, а не между «правильным» и «неправильным».
Видеолекции
Тайм-кода именно на эту тему в записях нет. Но глава «Теория вероятностей и распределения» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.
Связанные темы
Байесовские вычисления
Bayesian Inference85%
Байесовский вывод · Теория вероятностей и распределенияПараметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.
Variational Inference85%
Вариационный вывод · Теория вероятностей и распределенияАпостериорное распределение не сэмплируют, а приближают простым семейством: вывод превращается в задачу оптимизации.
Maximum Likelihood85%
Метод максимального правдоподобия · Теория вероятностей и распределенияПодобрать параметры так, чтобы наблюдаемые данные были при них наиболее вероятны.
Markov Chains85%
Марковские цепи · Теория вероятностей и распределенияПроцесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.
VAE85%
Вариационный автоэнкодер · Глубокое обучениеВероятностный автоэнкодер: кодирует объект в распределение и учится генерировать из латентного пространства.
KL Divergence85%
KL-дивергенция · Математический справочникНасколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.
Глава «Теория вероятностей и распределения» последний раз правилась . Нашли ошибку — напишите.