Теория вероятностей и распределения

MCMC

Марковские цепи Монте-Карло

актуальноТекущий рабочий стандарт

Направления: Основы · Статистика, Продвинутый ML · Вероятностный ML

Сэмплирование из апостериорного распределения, когда его нельзя выписать: цепь строится так, чтобы её стационарное распределение совпадало с целевым.

Обозначения
  • параметры модели
  • показатель степенного закона: чем он меньше, тем тяжелее хвост
  • вероятность события
  • распределение, предсказанное моделью
Вероятность принятия шага в M–H; у Гиббса предложение выбрано так, что это выражение всегда равно 1

Ключевые тезисы

  • Метрополис — Гастингс предлагает шаг и принимает его с вероятностью, зависящей от отношения плотностей.
  • Сэмплирование Гиббса — частный случай: каждая координата обновляется из своего полного условного распределения, и предложение всегда принимается.
  • Диагностика обязательна: burn-in, несколько цепей, и эффективный размер выборки.

Подробный разбор

2 подтемы — объяснения, формулы, примеры и интерактивные графики.

Апостериорное распределение известно с точностью до нормировочной константы: . Интеграл в знаменателе не берётся, но для сэмплирования он и не нужен — в правило принятия входит только отношение плотностей, в котором константа сокращается.

Метрополис — ГастингсСэмплирование Гиббса
Предложениепроизвольное распределение полное условное
Принятие шагас вероятностью всегда,
Что требуетсяуметь считать плотность с точностью до константыуметь сэмплировать из условных распределений
Настройкаширина шага: и слишком узкий, и слишком широкий плохинастраивать нечего
  1. Гиббс обновляет координаты по : , затем и так далее.
  2. Каждое такое обновление — шаг M–H, у которого предложение совпадает с целевым условным распределением, поэтому отношение в равно единице.
  3. Отсюда и ограничение: Гиббс применим, только когда из полных условных распределений можно сэмплировать напрямую — обычно в сопряжённых моделях.
На практике

Сильная параметров — беда Гиббса: координатные шаги двигаются вдоль осей и по вытянутому «оврагу» цепь ползёт очень медленно. В таких моделях берут HMC/NUTS, который использует плотности (Stan, PyMC, NumPyro).

  • Burn-in: первые сотни-тысячи сэмплов отбрасываются — цепь ещё идёт от случайной стартовой точки.
  • Несколько цепей из разных стартов: если они сошлись к разным областям, результат непригоден.
  • $\hat R$ (Gelman — Rubin): сравнивает разброс внутри цепи и между цепями; значение выше 1.01 — тревога.
  • ESS (effective sample size): сколько независимых сэмплов эквивалентны полученным; из-за обычно в разы меньше длины цепи.
На практике

даёт точный ответ в пределе бесконечного времени, — приближённый, но быстро. Выбор между ними — это выбор между точностью и масштабом, а не между «правильным» и «неправильным».

Видеолекции

Тайм-кода именно на эту тему в записях нет. Но глава «Теория вероятностей и распределения» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.

Связанные темы

Байесовские вычисления

Bayesian Inference85%

Байесовский вывод · Теория вероятностей и распределения

Параметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.

Variational Inference85%

Вариационный вывод · Теория вероятностей и распределения

Апостериорное распределение не сэмплируют, а приближают простым семейством: вывод превращается в задачу оптимизации.

Maximum Likelihood85%

Метод максимального правдоподобия · Теория вероятностей и распределения

Подобрать параметры так, чтобы наблюдаемые данные были при них наиболее вероятны.

Markov Chains85%

Марковские цепи · Теория вероятностей и распределения

Процесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.

VAE85%

Вариационный автоэнкодер · Глубокое обучение

Вероятностный автоэнкодер: кодирует объект в распределение и учится генерировать из латентного пространства.

KL Divergence85%

KL-дивергенция · Математический справочник

Насколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.

Кому эта тема нужна

Усиливает профиль: Исследователь.

Следующий шагДальше по связи: Bayesian InferenceПараметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.Перейти →

Глава «Теория вероятностей и распределения» последний раз правилась . Нашли ошибку — напишите.