Язык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.
- вероятность A при условии, что B произошло
- вероятность того, что произошли оба события
- сужаем пространство исходов до тех, где B верно, — и нормируем на них
Ключевые тезисы
- Совместное, маргинальное и условное распределения — три взгляда на одну и ту же модель мира.
- Байесовский подход трактует параметры как случайные величины с апостериорным распределением.
- Многие функции потерь — это отрицательное логарифмическое правдоподобие конкретного распределения.
Подробный разбор
3 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Случайные величины и распределения
Словарь, на котором говорят все вероятностные модели.
Случайная величина — это правило, сопоставляющее исходу число: «клиент ушёл» → 1, «остался» → 0. Распределение задаёт, с какими вероятностями величина принимает свои значения.
| Распределение | Где встречается в ML | Параметры |
|---|---|---|
| Бернулли | бинарная классификация, клик / не клик | |
| Биномиальное | число успехов из попыток, A/B-тесты | |
| Пуассона | число событий за интервал: заказы, отказы | |
| Нормальное | ошибки измерений, шум в регрессии | |
| Категориальное | многоклассовая классификация, softmax |
Выбор распределения — это и есть выбор функции потерь. Предположили нормальный шум — получили MSE; предположили Бернулли — получили логистические потери. Максимизация правдоподобия превращает вероятностную модель в конкретную формулу обучения.
2Условная вероятность и теорема Байеса
Как обновлять уверенность после того, как пришли новые данные.
Болезнь встречается у 1 из 1000 человек. Тест даёт положительный результат у 99% больных и ошибается у 5% здоровых. Тест положителен — какова вероятность болезни? , то есть меньше 2%. Редкость события важнее точности теста.
Ровно из-за этого accuracy бесполезна на редких классах, а precision в задачах фрода оказывается низкой даже у хорошей модели: положительных объектов мало, а ложные срабатывания копятся со всей огромной массы отрицательных.
3Математическое ожидание и дисперсия
Два числа, которыми описывают любое распределение в первом приближении.
- математическое ожидание — среднее по распределению
- дисперсия — мера разброса значений
- объект или аргумент функции
- вероятность (или плотность распределения)
- суммирование по всем перечисленным элементам
- Ожидание линейно всегда: , даже если величины зависимы.
- Дисперсия суммы независимых величин складывается — именно поэтому усреднение независимых моделей снижает разброс в раз.
- Функция потерь на выборке — это оценка ожидания потерь по неизвестному распределению данных.
Разложение ошибки — прямое следствие этих двух определений. Бэггинг бьёт по слагаемому Var, бустинг — по Bias.
Связанные темы
Распределения и их хвосты · Байесовский подход · Вероятность и информация
Beta Distribution95%
Бета-распределение · Теория вероятностей и распределенияРаспределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.
Probability Distribution94%
Распределение вероятностей · Математический справочникЗакон, задающий вероятности значений случайной величины.
Bayes Theorem93%
Теорема Байеса · Математический справочникПравило пересчёта вероятности гипотезы после получения новых данных.
Naive Bayes93%
Наивный байесовский классификатор · Классическое машинное обучениеПрименяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.
Normal Distribution80%
Нормальное распределение · Теория вероятностей и распределенияКолоколообразное распределение с двумя параметрами. Максимально энтропийное при заданных среднем и дисперсии — поэтому его берут «по умолчанию».
Log-normal Distribution80%
Логнормальное распределение · Теория вероятностей и распределенияВеличина, логарифм которой нормален. Возникает там, где эффекты перемножаются, а не складываются.
Power Law80%
Степенное распределение · Теория вероятностей и распределенияПлотность убывает как степень: редкие события встречаются намного чаще, чем предсказывает нормальный закон. Распределения Парето и Ципфа — его классические формы.
Poisson Distribution80%
Распределение Пуассона · Теория вероятностей и распределенияЧисло редких независимых событий за фиксированный интервал: заказы за час, отказы за сутки, клики за сессию.
Exponential Distribution80%
Экспоненциальное распределение · Теория вероятностей и распределенияВремя между пуассоновскими событиями. Единственное непрерывное распределение без памяти.
Binomial & Bernoulli80%
Бернулли и биномиальное · Теория вероятностей и распределенияОдин успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.
Heavy Tails80%
Тяжёлые хвосты · Теория вероятностей и распределенияРаспределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.
Bayesian Inference75%
Байесовский вывод · Теория вероятностей и распределенияПараметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.
Markov Chains75%
Марковские цепи · Теория вероятностей и распределенияПроцесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.
Conditional Independence75%
Условная независимость · Теория вероятностей и распределенияДве величины независимы при известной третьей. Понятие, на котором стоят байесовские сети и наивный классификатор.
Probability Axioms75%
Аксиомы вероятности · Теория вероятностей и распределенияТри аксиомы Колмогорова, из которых выводится вся теория: неотрицательность, нормировка и аддитивность.
Random Variables75%
Случайные величины · Теория вероятностей и распределенияОтображение исходов в числа. Дискретные описываются функцией вероятности, непрерывные — плотностью.
Bayesian Optimization75%
Байесовская оптимизация · Практика MLСтроит модель зависимости метрики от гиперпараметров и выбирает следующую точку осознанно.
Statistics70%
Статистика · ОсновыКак от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.
Information Theory70%
Теория информации · ОсновыИзмеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.
Expectation70%
Математическое ожидание · Математический справочникСреднее значение случайной величины по её распределению.
Variance70%
Дисперсия · Математический справочникМера разброса значений вокруг среднего.
Covariance70%
Ковариация · Математический справочникМера совместной изменчивости двух величин; корреляция — её нормированная версия.
Entropy70%
Энтропия · Математический справочникМера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.
KL Divergence70%
KL-дивергенция · Математический справочникНасколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.
Cross-Entropy70%
Кросс-энтропия · Математический справочникОжидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).
Log Loss70%
Логарифмические потери · МетрикиОценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.