Классическое машинное обучение

PCA

Метод главных компонент

актуальноТекущий рабочий стандарт

Ортогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.

Ключевые тезисы

  • Компоненты — собственные векторы ковариационной матрицы, вычисляются через SVD.
  • Число компонент подбирают по доле объяснённой дисперсии (например, 95%).
  • Требует предварительной стандартизации и плохо ловит нелинейную структуру.
Тема также относится к главам:Обучение без учителяСнижение размерности

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Как считается PCA

Четыре шага от сырых данных до главных компонент.

  1. Центрировать данные (и обычно стандартизировать).
  2. Посчитать ковариационную матрицу .
  3. Найти её собственные векторы и значения (на практике — через SVD матрицы ).
  4. Отсортировать по убыванию и взять первые векторов как новый базис.
Обозначения
  • сила регуляризации
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • суммирование по всем перечисленным элементам
Обычный критерий выбора : 90–95%
PC1PC2
λ₁0.711
λ₂0.041
объяснённая дисперсия PC194.5%
PC1 — направление максимального разброса, PC2 ему ортогонально; синие точки — проекции на PC1
2

Границы применимости

Где PCA помогает, а где вредит.

  • PCA не знает про целевую переменную: он может выбросить компоненту с малой дисперсией, но огромной предсказательной силой.
  • Без стандартизации компоненты определяются признаком с самым большим масштабом.
  • Компоненты — линейные комбинации всех признаков, поэтому интерпретируемость теряется.
  • Нелинейную структуру (спираль, кольцо) PCA не развернёт — нужны Kernel PCA, UMAP или автоэнкодеры.
На практике

Частое полезное применение — не сжатие ради сжатия, а декорреляция и борьба с мультиколлинеарностью перед линейной моделью.

Связанные темы

Представления и снижение размерности · Линейная алгебра в ML

Eigenvalue91%

Собственное значение · Математический справочник

Коэффициент растяжения вдоль направления, которое преобразование не поворачивает.

Eigenvector91%

Собственный вектор · Математический справочник

Направление, сохраняющееся при линейном преобразовании с точностью до масштаба.

Dimensionality reduction70%

Снижение размерности · Данные

Проекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.

Dimensionality Reduction70%

Снижение размерности · Обучение без учителя

Компактное представление данных, сохраняющее важную часть структуры.

Representation Learning70%

Обучение представлений · Обучение без учителя

Модель сама учится полезным признакам, чаще всего через self-supervised задачи.

Autoencoders70%

Автоэнкодеры · Глубокое обучение

Сеть учится восстанавливать вход через узкое место, получая сжатое представление.

Embeddings70%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

Linear Algebra70%

Линейная алгебра · Основы

Векторы и матрицы — способ описать данные и преобразования над ними. Обучение модели почти всегда сводится к последовательности матричных операций.

Vector70%

Вектор · Математический справочник

Упорядоченный набор чисел; в ML — представление объекта в пространстве признаков.

Matrix70%

Матрица · Математический справочник

Прямоугольная таблица чисел, задающая линейное преобразование или набор объектов.

Norm70%

Норма · Математический справочник

Мера длины вектора; выбор нормы определяет геометрию задачи.

Distance70%

Расстояние · Математический справочник

Мера непохожести объектов — основа кластеризации, k-NN и поиска.

Metric spaces70%

Метрические пространства · Топологический анализ данных

Множество с функцией расстояния. Любой TDA-пайплайн начинается с выбора метрики.