Основы

Probability

Теория вероятностей

актуальноТекущий рабочий стандарт

Язык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.

Что означает каждый компонент
  • вероятность A при условии, что B произошло
  • вероятность того, что произошли оба события
  • сужаем пространство исходов до тех, где B верно, — и нормируем на них

Ключевые тезисы

  • Совместное, маргинальное и условное распределения — три взгляда на одну и ту же модель мира.
  • Байесовский подход трактует параметры как случайные величины с апостериорным распределением.
  • Многие функции потерь — это отрицательное логарифмическое правдоподобие конкретного распределения.

Подробный разбор

3 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Случайные величины и распределения

Словарь, на котором говорят все вероятностные модели.

Случайная величина — это правило, сопоставляющее исходу число: «клиент ушёл» → 1, «остался» → 0. Распределение задаёт, с какими вероятностями величина принимает свои значения.

РаспределениеГде встречается в MLПараметры
Бернуллибинарная классификация, клик / не клик
Биномиальноечисло успехов из попыток, A/B-тесты
Пуассоначисло событий за интервал: заказы, отказы
Нормальноеошибки измерений, шум в регрессии
Категориальноемногоклассовая классификация, softmax

Выбор распределения — это и есть выбор функции потерь. Предположили нормальный шум — получили MSE; предположили Бернулли — получили логистические потери. Максимизация правдоподобия превращает вероятностную модель в конкретную формулу обучения.

2

Условная вероятность и теорема Байеса

Как обновлять уверенность после того, как пришли новые данные.

Апостериорное = правдоподобие × априорное / нормировка
Классический парадокс теста

Болезнь встречается у 1 из 1000 человек. Тест даёт положительный результат у 99% больных и ошибается у 5% здоровых. Тест положителен — какова вероятность болезни? , то есть меньше 2%. Редкость события важнее точности теста.

Ровно из-за этого accuracy бесполезна на редких классах, а precision в задачах фрода оказывается низкой даже у хорошей модели: положительных объектов мало, а ложные срабатывания копятся со всей огромной массы отрицательных.

0.000.250.500.751.00оценка моделипорогкласс 0класс 1
Precision0.941
Recall0.841
F10.888
Accuracy0.936
TP / FP / FN252 / 16 / 48
Уменьшите долю класса 1 и посмотрите, как рушится precision при неизменном качестве модели
3

Математическое ожидание и дисперсия

Два числа, которыми описывают любое распределение в первом приближении.

Обозначения
  • математическое ожидание — среднее по распределению
  • дисперсия — мера разброса значений
  • объект или аргумент функции
  • вероятность (или плотность распределения)
  • суммирование по всем перечисленным элементам
  • Ожидание линейно всегда: , даже если величины зависимы.
  • Дисперсия суммы независимых величин складывается — именно поэтому усреднение независимых моделей снижает разброс в раз.
  • Функция потерь на выборке — это оценка ожидания потерь по неизвестному распределению данных.
На практике

Разложение ошибки — прямое следствие этих двух определений. Бэггинг бьёт по слагаемому Var, бустинг — по Bias.

Связанные темы

Распределения и их хвосты · Байесовский подход · Вероятность и информация

Beta Distribution95%

Бета-распределение · Теория вероятностей и распределения

Распределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.

Probability Distribution94%

Распределение вероятностей · Математический справочник

Закон, задающий вероятности значений случайной величины.

Bayes Theorem93%

Теорема Байеса · Математический справочник

Правило пересчёта вероятности гипотезы после получения новых данных.

Naive Bayes93%

Наивный байесовский классификатор · Классическое машинное обучение

Применяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.

Normal Distribution80%

Нормальное распределение · Теория вероятностей и распределения

Колоколообразное распределение с двумя параметрами. Максимально энтропийное при заданных среднем и дисперсии — поэтому его берут «по умолчанию».

Log-normal Distribution80%

Логнормальное распределение · Теория вероятностей и распределения

Величина, логарифм которой нормален. Возникает там, где эффекты перемножаются, а не складываются.

Power Law80%

Степенное распределение · Теория вероятностей и распределения

Плотность убывает как степень: редкие события встречаются намного чаще, чем предсказывает нормальный закон. Распределения Парето и Ципфа — его классические формы.

Poisson Distribution80%

Распределение Пуассона · Теория вероятностей и распределения

Число редких независимых событий за фиксированный интервал: заказы за час, отказы за сутки, клики за сессию.

Exponential Distribution80%

Экспоненциальное распределение · Теория вероятностей и распределения

Время между пуассоновскими событиями. Единственное непрерывное распределение без памяти.

Binomial & Bernoulli80%

Бернулли и биномиальное · Теория вероятностей и распределения

Один успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.

Heavy Tails80%

Тяжёлые хвосты · Теория вероятностей и распределения

Распределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.

Bayesian Inference75%

Байесовский вывод · Теория вероятностей и распределения

Параметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.

Markov Chains75%

Марковские цепи · Теория вероятностей и распределения

Процесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.

Conditional Independence75%

Условная независимость · Теория вероятностей и распределения

Две величины независимы при известной третьей. Понятие, на котором стоят байесовские сети и наивный классификатор.

Probability Axioms75%

Аксиомы вероятности · Теория вероятностей и распределения

Три аксиомы Колмогорова, из которых выводится вся теория: неотрицательность, нормировка и аддитивность.

Random Variables75%

Случайные величины · Теория вероятностей и распределения

Отображение исходов в числа. Дискретные описываются функцией вероятности, непрерывные — плотностью.

Bayesian Optimization75%

Байесовская оптимизация · Практика ML

Строит модель зависимости метрики от гиперпараметров и выбирает следующую точку осознанно.

Statistics70%

Статистика · Основы

Как от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.

Information Theory70%

Теория информации · Основы

Измеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.

Expectation70%

Математическое ожидание · Математический справочник

Среднее значение случайной величины по её распределению.

Variance70%

Дисперсия · Математический справочник

Мера разброса значений вокруг среднего.

Covariance70%

Ковариация · Математический справочник

Мера совместной изменчивости двух величин; корреляция — её нормированная версия.

Entropy70%

Энтропия · Математический справочник

Мера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.

KL Divergence70%

KL-дивергенция · Математический справочник

Насколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.

Cross-Entropy70%

Кросс-энтропия · Математический справочник

Ожидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).

Log Loss70%

Логарифмические потери · Метрики

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.