Основы

Information Theory

Теория информации

актуальноТекущий рабочий стандарт

Измеряет количество информации и различие между распределениями. Отсюда родом энтропия, кросс-энтропия и KL-дивергенция.

Что означает каждый компонент
  • вероятность исхода — вес в среднем
  • количество информации в исходе: чем он реже, тем больше несёт

Ключевые тезисы

  • Энтропия — средняя неожиданность события, минимальная длина кода для сообщения.
  • Кросс-энтропия — стандартная функция потерь в классификации и языковых моделях.
  • KL-дивергенция измеряет цену использования неверного распределения вместо истинного.
Тема также относится к главам:Математический справочникТеория информации

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Энтропия: сколько информации в ответе

Мера неопределённости, из которой выросли и деревья, и языковые модели.

Обозначения
  • энтропия — мера неопределённости распределения
  • объект или аргумент функции
  • вероятность (или плотность распределения)
  • суммирование по всем перечисленным элементам
  • логарифм: превращает произведения в суммы и сжимает масштаб
Средняя «неожиданность» события, измеренная в битах

Честная монета: бит — максимальная неопределённость. Монета, всегда падающая орлом: , результат известен заранее. Именно поэтому решающее дерево ищет разбиение, максимально снижающее энтропию: оно ищет вопрос, ответ на который несёт больше всего информации.

0.000.250.500.751.000.00.51.0pH, битq
H(p)1.000 бит
H(p, q)1.000 бит
KL(p‖q)0.000 бит
Энтропия Бернулли: максимум при $p = 0.5$; сдвиньте $q$, чтобы увидеть кросс-энтропию и KL
2

Кросс-энтропия и KL-дивергенция

Цена того, что модель ошибается в своём представлении о мире.

Обозначения
  • KL-дивергенция: насколько одно распределение отличается от другого
  • энтропия — мера неопределённости распределения
  • объект или аргумент функции
  • вероятность (или плотность распределения)
  • распределение, предсказанное моделью
  • суммирование по всем перечисленным элементам
  • норма — длина вектора
Кросс-энтропия = неустранимая энтропия данных + штраф за неверную модель

от модели не зависит, поэтому минимизация кросс-энтропии эквивалентна минимизации KL-дивергенции между истинным распределением и предсказанным. Это и есть обучение классификатора: подгонять под .

  • KL несимметрична: , поэтому это не метрика.
  • Уверенная ошибка ( там, где ) даёт бесконечный штраф — отсюда чувствительность log loss.
  • Перплексия языковой модели — это : «сколько равновероятных вариантов модель в среднем рассматривает».

Связанные темы

Вероятность и информация

Probability70%

Теория вероятностей · Основы

Язык неопределённости: распределения, условные вероятности и теорема Байеса описывают, как данные порождаются и как обновлять убеждения.

Statistics70%

Статистика · Основы

Как от выборки перейти к выводам о генеральной совокупности: оценки, доверительные интервалы и проверка гипотез.

Probability Distribution70%

Распределение вероятностей · Математический справочник

Закон, задающий вероятности значений случайной величины.

Expectation70%

Математическое ожидание · Математический справочник

Среднее значение случайной величины по её распределению.

Variance70%

Дисперсия · Математический справочник

Мера разброса значений вокруг среднего.

Covariance70%

Ковариация · Математический справочник

Мера совместной изменчивости двух величин; корреляция — её нормированная версия.

Entropy70%

Энтропия · Математический справочник

Мера неопределённости распределения: максимальна при равномерном, нулевая при детерминированном.

KL Divergence70%

KL-дивергенция · Математический справочник

Насколько распределение q плохо описывает распределение p; несимметрична и не является метрикой.

Cross-Entropy70%

Кросс-энтропия · Математический справочник

Ожидаемая длина кода при использовании q для данных из p: энтропия p плюс KL(p‖q).

Bayes Theorem70%

Теорема Байеса · Математический справочник

Правило пересчёта вероятности гипотезы после получения новых данных.

Naive Bayes70%

Наивный байесовский классификатор · Классическое машинное обучение

Применяет теорему Байеса при «наивном» предположении о независимости признаков — и работает лучше, чем должно.

Log Loss70%

Логарифмические потери · Метрики

Оценивает качество самих вероятностей, а не только меток: уверенная ошибка штрафуется очень сильно.