Математический справочник

Correlation

Корреляция

актуальноТекущий рабочий стандарт

Направления: Основы · Статистика, Продвинутый ML · Причинный ML

Нормированная мера связи двух величин: , поделённая на разброс каждой из них.

Обозначения
  • стандартное отклонение — разброс величины
  • награда, полученная агентом на шаге
Пирсон — это в единицах стандартных отклонений, поэтому масштаб не важен

Ключевые тезисы

  • Коэффициент Пирсона измеряет линейную связь и лежит в диапазоне от −1 до +1; 0 означает отсутствие линейной связи, но не независимость.
  • Спирмен и Кендалл работают с рангами: ловят любую монотонную связь и устойчивы к выбросам.
  • не означает причинность — совпадение может создавать общий скрытый фактор или отбор выборки.

Подробный разбор

2 подтемы — объяснения, формулы, примеры и интерактивные графики.

КоэффициентЧто ловитДиапазонУстойчивость к выбросам
Пирсонлинейную связьот −1 до +1низкая
Спирменлюбую монотонную связь (по рангам)от −1 до +1высокая
Кендаллсогласованность пар наблюденийот −1 до +1высокая
Обозначения
  • награда, полученная агентом на шаге
  • истинное значение целевой переменной
  • вектор или точка пространства признаков
  • суммирование по всем перечисленным элементам
Пирсон: , нормированная на разбросы обеих величин

Ноль по Пирсону означает отсутствие линейной связи, а не независимость: у точек, лежащих на параболе, может быть строго нулевой при жёсткой функциональной зависимости. Поэтому корреляционную всегда смотрят вместе с диаграммами рассеяния.

  • Причинность. Связь может создавать общий скрытый фактор: продажи мороженого и утопления растут вместе из-за жары.
  • Отбор выборки. , посчитанная на усечённой выборке (только одобренные заявки), систематически отличается от истинной.
  • Парадокс Симпсона. Знак связи внутри каждой группы может быть противоположен знаку связи в объединённых данных.
На практике

В отборе полезна в другую сторону: пара признаков с почти наверняка избыточна, и в линейной модели такая пара даёт нестабильные коэффициенты (мультиколлинеарность).

Тема также относится к главам:ДанныеРазведка и визуализация · Признаки

Видеолекции

Тайм-кода именно на эту тему в записях нет. Но глава «Математический справочник» разобрана в курсе целиком — с той оговоркой, что место в записи придётся искать самому.

Связанные темы

Интерпретируемая статистика

Generalized Additive Models75%

Обобщённые аддитивные модели · Классическое машинное обучение

Сумма гладких функций от отдельных признаков: нелинейность есть, а интерпретируемость линейной модели сохраняется.

Linear Regression75%

Линейная регрессия · Классическое машинное обучение

Предсказывает число как взвешенную сумму признаков. Самый интерпретируемый бейзлайн и основа для более сложных моделей.

Partial Dependence75%

Partial Dependence Plot · Интерпретируемость моделей

Показывает средний эффект признака на предсказание при усреднении по остальным признакам.

Feature selection75%

Отбор признаков · Данные

Убираем шумные и избыточные признаки, чтобы снизить переобучение, ускорить инференс и упростить интерпретацию.

Data Visualization75%

Визуализация данных · Данные

Графики как инструмент разведки: увидеть распределения, связи и аномалии до того, как обучена первая модель.

Проверить себя

Тема встречается в тесте по направлениям — ошибки приведут обратно на эту страницу.

Следующий шагПроверить себя: Статистика и вероятностьТема встречается в этом тесте 1 раз. Ошибка приведёт обратно на эту страницу — с объяснением, что именно не сошлось.Перейти →

Глава «Математический справочник» последний раз правилась . Нашли ошибку — напишите.