Математический справочник

Entropy

Энтропия

актуальноТекущий рабочий стандарт

Мера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.

Что означает каждый компонент
  • вероятность исхода — вес, с которым он входит в среднее
  • «неожиданность» исхода в битах: редкое событие несёт много информации, частое — мало
Энтропия — средняя неожиданность: максимум при равновероятных исходах

Ключевые тезисы

  • Измеряется в битах при логарифме по основанию 2.
  • Критерий разбиения в решающих деревьях (information gain).
  • Определяет нижнюю границу длины кода сообщения.
Тема также относится к главам:ОсновыВероятность и статистика

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Энтропия в битах

Сколько вопросов «да/нет» нужно задать в среднем.

Обозначения
  • энтропия — мера неопределённости распределения
  • вектор или точка пространства признаков
  • вероятность (или показатель нормы)
  • суммирование по всем перечисленным элементам
  • логарифм: превращает произведения в суммы и сжимает масштаб
Пример

Восемь равновероятных исходов: бита — ровно три вопроса с делением пополам. Если один исход имеет вероятность 0.99, энтропия падает почти до нуля: обычно ответ известен заранее.

0.000.250.500.751.000.00.51.0pH, битq
H(p)1.000 бит
H(p, q)1.000 бит
KL(p‖q)0.000 бит
Энтропия Бернулли максимальна при p = 0.5 и обращается в ноль на концах
2

Энтропия в решающих деревьях

Как теоретико-информационная величина стала критерием разбиения.

Дерево ищет вопрос, максимально снижающий неопределённость ответа. Information Gain — это в точности разность энтропий до и после разбиения, взвешенная по размерам частей.

t = 0.50слева: 8 объектовсправа: 7 объектов
H(корень)0.498
H(лево)0.375
H(право)0.245
Information Gain0.183
Критерий информативности
Переключите критерий на энтропию: значения изменятся, но выбранный порог обычно останется тем же

Связанные темы

Вероятность и информация

Probability70%

Теория вероятностей · Основы

Язык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.

Statistics70%

Статистика · Основы

Как от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.

Information Theory70%

Теория информации · Основы

Измеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.

Probability Distribution70%

Распределение вероятностей · Математический справочник

Закон, задающий вероятности значений случайной величины.

Expectation70%

Математическое ожидание · Математический справочник

Среднее значение случайной величины по её распределению.

Variance70%

Дисперсия · Математический справочник

Мера разброса значений вокруг среднего.

Covariance70%

Ковариация · Математический справочник

Мера совместной изменчивости двух величин; корреляция — её нормированная версия.

KL Divergence70%

KL-дивергенция · Математический справочник

Насколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.

Cross-Entropy70%

Кросс-энтропия · Математический справочник

Ожидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).

Bayes Theorem70%

Теорема Байеса · Математический справочник

Правило пересчёта вероятности гипотезы после получения новых данных.

Naive Bayes70%

Наивный байесовский классификатор · Классическое машинное обучение

Применяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.

Log Loss70%

Логарифмические потери · Метрики

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.