Теория вероятностей и распределения

Log-normal Distribution

Логнормальное распределение

актуальноТекущий рабочий стандарт

Величина, логарифм которой нормален. Возникает там, где эффекты перемножаются, а не складываются.

Что означает каждый компонент
  • логарифм величины — именно он распределён нормально, а не сама величина
  • среднее логарифма и его разброс. Среднее самой величины равно e^(μ+σ²/2) и всегда больше медианы e^μ

Ключевые тезисы

  • Типичные примеры: доходы, длительности сессий, размеры файлов, цены.
  • Среднее заметно больше медианы — отчёт по среднему вводит в заблуждение.
  • Практика: логарифмировать целевую переменную и обучаться на ней.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Откуда берётся

Мультипликативный аналог ЦПТ.

Если величина формируется как произведение множества независимых случайных множителей, её логарифм — сумма, и по ЦПТ он нормален. Так рост доходов, цен и размеров файлов естественно приводит к логнормальному распределению.

Обозначения
  • математическое ожидание — среднее по распределению
  • стандартное отклонение — разброс величины
  • среднее значение
  • экспонента
Среднее всегда больше медианы — и тем сильнее, чем больше σ
2

Работа с логнормальной целью

Как обучать и как возвращаться к исходной шкале.

y_log = np.log1p(y)
model.fit(X_train, y_log)
pred = np.expm1(model.predict(X_test))     # это медиана, не среднее
# Поправка Дюана, если нужно именно среднее:
resid = y_log_train - model.predict(X_train)
smearing = np.mean(np.exp(resid))
pred_mean = np.expm1(model.predict(X_test)) * smearing
На практике

Метрику тоже считайте осознанно: RMSLE штрафует относительную ошибку и согласуется с логарифмическим обучением, а RMSE на исходной шкале будет определяться несколькими крупными объектами.

Связанные темы

Распределения и их хвосты · Тяжёлые хвосты и риск

Power Law95%

Степенное распределение · Теория вероятностей и распределения

Плотность убывает как степень: редкие события встречаются намного чаще, чем предсказывает нормальный закон. Распределения Парето и Ципфа — его классические формы.

Heavy Tails95%

Тяжёлые хвосты · Теория вероятностей и распределения

Распределения, у которых экстремальные значения не являются пренебрежимо редкими. Именно они ломают привычные оценки и метрики.

Normal Distribution80%

Нормальное распределение · Теория вероятностей и распределения

Колоколообразное распределение с двумя параметрами. Максимально энтропийное при заданных среднем и дисперсии — поэтому его берут «по умолчанию».

Poisson Distribution80%

Распределение Пуассона · Теория вероятностей и распределения

Число редких независимых событий за фиксированный интервал: заказы за час, отказы за сутки, клики за сессию.

Exponential Distribution80%

Экспоненциальное распределение · Теория вероятностей и распределения

Время между пуассоновскими событиями. Единственное непрерывное распределение без памяти.

Binomial & Bernoulli80%

Бернулли и биномиальное · Теория вероятностей и распределения

Один успех или число успехов в серии независимых испытаний — базовая модель конверсии и кликов.

Beta Distribution80%

Бета-распределение · Теория вероятностей и распределения

Распределение вероятности на отрезке [0,1] — естественный априор для конверсии и для многоруких бандитов.

Probability Distribution80%

Распределение вероятностей · Математический справочник

Закон, задающий вероятности значений случайной величины.

Probability80%

Теория вероятностей · Основы

Язык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.

Extreme Value Theory75%

Теория экстремальных значений · Теория вероятностей и распределения

Аппарат для моделирования максимумов и хвостов: как оценить вероятность события, которого ещё не случалось.

Complex Systems75%

Сложные системы · Динамические системы и фракталы

Системы из множества взаимодействующих элементов, где коллективное поведение не сводится к сумме частей.

Self-similarity75%

Самоподобие · Динамические системы и фракталы

Свойство структуры повторять себя на разных масштабах — точно или статистически.

Scale-free Networks75%

Безмасштабные сети · Графы и сети

Сети, в которых распределение степеней вершин подчиняется степенному закону: немного «хабов» и очень много слабо связанных вершин.

Outliers75%

Выбросы · Данные

Наблюдения, резко отличающиеся от остальных. Они бывают ошибками измерения, а бывают самым ценным сигналом.

MAPE75%

Средняя абсолютная процентная ошибка · Метрики

Относительная ошибка в процентах — удобна для сравнения рядов разного масштаба.