Теория вероятностей и распределения

Maximum Likelihood

Метод максимального правдоподобия

актуальноТекущий рабочий стандарт

Направления: Основы · Вероятность, Продвинутый ML · Вероятностный ML

Подобрать параметры так, чтобы наблюдаемые данные были при них наиболее вероятны.

Обозначения
  • оценка параметра по выборке
  • параметры модели
  • значение случайной величины
  • число наблюдений или испытаний
  • вероятность события
  • суммирование по всем перечисленным элементам
  • аргумент, при котором выражение минимально (или максимально)
— это то же выражение плюс логарифм априорного распределения (оценка )

Ключевые тезисы

  • Максимизируют логарифм : произведение вероятностей превращается в сумму и не переполняется.
  • MLE для нормального шума даёт метод наименьших квадратов, для Бернулли — с log-loss.
  • Оценка состоятельна и асимптотически эффективна, но смещена на малых выборках и склонна к без .

Какую задачу решает

У нас есть данные и семейство распределений, из которого они, предположительно, порождены. Вопрос: какие параметры этого семейства выбрать? отвечает так: те, при которых вероятность получить именно эти наблюдения максимальна. Правдоподобие — это та же плотность, но рассматриваемая как функция параметра при фиксированных данных.

Практическая ценность метода в том, что он превращает содержательное предположение о шуме в конкретную . Нормальный шум даёт метод наименьших квадратов, шум Лапласа — среднюю абсолютную ошибку, схема Бернулли — с log-loss. Обучение почти любой модели с вероятностным выходом — это максимизация логарифма , записанная со знаком минус.

Почему MSE — это нормальный шум

Пусть , где шум нормален со средним 0 и . Тогда логарифм плотности одного наблюдения равен плюс константа. Суммируя по выборке и меняя знак, получаем ровно сумму квадратов ошибок. Отсюда практический вывод: применяя к данным с , вы утверждаете, что шум нормален, а он не нормален — и модель будет гнаться за .

Подробный разбор

2 подтемы — объяснения, формулы, примеры и интерактивные графики.

Обозначения
  • параметры модели
  • значение случайной величины
  • число наблюдений или испытаний
  • вероятность события
  • функция потерь — то, что минимизируется при обучении
  • суммирование по всем перечисленным элементам
  • произведение по всем элементам
Логарифм превращает произведение в сумму: и численно устойчиво, и дифференцировать проще
Предположение о шумеЧто даёт MLE
Нормальный шум с постоянной метод наименьших квадратов ()
Лапласовский шумминимизация
Бернулли, log-loss
Пуассонпуассоновская регрессия для счётчиков

Отсюда практический вывод: выбор — это заявление о распределении шума. на данных с плоха не «эмпирически», а потому что предполагает нормальность, которой нет.

  • Состоятельность: с ростом выборки оценка сходится к истинному параметру.
  • Асимптотическая эффективность: достигает нижней границы Крамера — Рао, точнее оценить нельзя.
  • Смещение на малых выборках: классический пример — MLE делит на , а несмещённая оценка на .
  • Переобучение: максимум на гибкой модели упирается в идеальную подгонку под данные — отсюда .
Обозначения
  • оценка параметра по выборке
  • параметры модели
  • вероятность события
  • аргумент, при котором выражение минимально (или максимально)
  • логарифм: превращает произведения в суммы и сжимает масштаб
— то же плюс априорное распределение; L2-регуляризация есть в точности гауссов приор

Где применяется

  • Подгонка распределенияОценка параметров нормального, пуассоновского или экспоненциального распределения по выборке.
  • Обучение моделей, GLM, смеси гауссиан, — везде максимум .
  • Выбор Осознанный переход к или пуассоновской регрессии вместо по свойствам шума.
  • Сравнение моделейAIC и BIC строятся на достигнутом значении со штрафом за число параметров.

Плюсы, минусы и альтернативы

Плюсы

  • Универсальный рецепт: любое вероятностное предположение переводится в задачу оптимизации.
  • Асимптотически эффективен — точнее оценить параметр по этим данным нельзя.
  • Даёт не только оценку, но и её точность через информацию Фишера.

Минусы

  • Смещён на малых выборках: классический пример — оценка с делением на .
  • Чувствителен к неверному предположению о распределении: не тот шум — не та .
  • На гибких моделях максимум достигается , если нет .

Брать, если

  • Есть содержательное предположение о том, как порождены данные.
  • Нужна точечная оценка параметров и мера её точности.

Не брать, если

  • Важна полная неопределённость параметра — нужен , а не точка.
  • Выборка мала, а модель сложна: уйдёт в .

Чем заменяют

Видеолекции

Тайм-кода именно на эту тему в записях нет. Но глава «Теория вероятностей и распределения» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.

Связанные темы

Байесовские вычисления

Bayesian Inference85%

Байесовский вывод · Теория вероятностей и распределения

Параметры модели рассматриваются как случайные величины; данные обновляют априорное распределение в апостериорное.

MCMC85%

Марковские цепи Монте-Карло · Теория вероятностей и распределения

Сэмплирование из апостериорного распределения, когда его нельзя выписать: цепь строится так, чтобы её стационарное распределение совпадало с целевым.

Variational Inference85%

Вариационный вывод · Теория вероятностей и распределения

Апостериорное распределение не сэмплируют, а приближают простым семейством: вывод превращается в задачу оптимизации.

Markov Chains85%

Марковские цепи · Теория вероятностей и распределения

Процесс, в котором будущее зависит только от текущего состояния. База для MDP, MCMC и моделей поведения пользователя.

VAE85%

Вариационный автоэнкодер · Глубокое обучение

Вероятностный автоэнкодер: кодирует объект в распределение и учится генерировать из латентного пространства.

KL Divergence85%

KL-дивергенция · Математический справочник

Насколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.

Проверить себя

Тема встречается в тесте по направлениям — ошибки приведут обратно на эту страницу.

Следующий шагПроверить себя: Статистика и вероятностьТема встречается в этом тесте 2 раза. Ошибка приведёт обратно на эту страницу — с объяснением, что именно не сошлось.Перейти →

Глава «Теория вероятностей и распределения» последний раз правилась . Нашли ошибку — напишите.