Математический справочник

Bayes Theorem

Теорема Байеса

актуальноТекущий рабочий стандарт

Правило пересчёта вероятности гипотезы после получения новых данных.

Что означает каждый компонент
  • апостериорное: во что мы верим после того, как увидели данные
  • правдоподобие: насколько данные ожидаемы, если гипотеза верна
  • априорное убеждение, нормированное на вероятность самих данных. Именно оно объясняет парадокс редких болезней

Ключевые тезисы

  • Апостериорное ∝ правдоподобие × априорное.
  • Основа наивного байесовского классификатора и байесовского вывода.
  • Объясняет парадокс редких болезней: при низком априоре даже точный тест часто ошибается.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Применение в ML

От спам-фильтра до интерпретации метрик.

  • Naive Bayes — прямое применение с предположением независимости признаков.
  • Байесовская оптимизация — обновление представления о ландшафте метрики после каждого запуска.
  • Интерпретация precision — при редком классе низкая точность неизбежна даже у хорошей модели.
0.000.250.500.751.00оценка моделипорогкласс 0класс 1
Precision0.941
Recall0.841
F10.888
Accuracy0.936
TP / FP / FN252 / 16 / 48
Меняйте долю положительного класса: это и есть априорная вероятность из формулы Байеса
2

Априорные распределения

Как знание до данных превращается в регуляризацию.

Максимизация апостериорной вероятности (MAP) с нормальным априорным распределением весов в точности эквивалентна L2-регуляризации, а с распределением Лапласа — L1.

Обозначения
  • сила регуляризации: штраф за сложность модели
  • веса модели — то, что подбирается при обучении
  • вероятность (или показатель нормы)
  • функция, по которой берут производную
  • аргумент, при котором выражение минимально (или максимально)
  • норма — длина вектора
  • логарифм: превращает произведения в суммы и сжимает масштаб
На практике

Это одна из самых красивых связок в ML: регуляризация — не эвристика, а формализованное априорное убеждение о том, что веса не должны быть большими.

Связанные темы

Байесовский подход · Вероятность и информация

Naive Bayes93%

Наивный байесовский классификатор · Классическое машинное обучение

Применяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.

Probability93%

Теория вероятностей · Основы

Язык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.

Bayesian Inference75%

Байесовский вывод · Теория вероятностей и распределения

Параметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.

Markov Chains75%

Марковские цепи · Теория вероятностей и распределения

Процесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.

Beta Distribution75%

Бета-распределение · Теория вероятностей и распределения

Распределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.

Conditional Independence75%

Условная независимость · Теория вероятностей и распределения

Две величины независимы при известной третьей. Понятие, на котором стоят байесовские сети и наивный классификатор.

Probability Axioms75%

Аксиомы вероятности · Теория вероятностей и распределения

Три аксиомы Колмогорова, из которых выводится вся теория: неотрицательность, нормировка и аддитивность.

Random Variables75%

Случайные величины · Теория вероятностей и распределения

Отображение исходов в числа. Дискретные описываются функцией вероятности, непрерывные — плотностью.

Bayesian Optimization75%

Байесовская оптимизация · Практика ML

Строит модель зависимости метрики от гиперпараметров и выбирает следующую точку осознанно.

Statistics70%

Статистика · Основы

Как от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.

Information Theory70%

Теория информации · Основы

Измеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.

Probability Distribution70%

Распределение вероятностей · Математический справочник

Закон, задающий вероятности значений случайной величины.

Expectation70%

Математическое ожидание · Математический справочник

Среднее значение случайной величины по её распределению.

Variance70%

Дисперсия · Математический справочник

Мера разброса значений вокруг среднего.

Covariance70%

Ковариация · Математический справочник

Мера совместной изменчивости двух величин; корреляция — её нормированная версия.

Entropy70%

Энтропия · Математический справочник

Мера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.

KL Divergence70%

KL-дивергенция · Математический справочник

Насколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.

Cross-Entropy70%

Кросс-энтропия · Математический справочник

Ожидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).

Log Loss70%

Логарифмические потери · Метрики

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.