Ортогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.
Ключевые тезисы
- Компоненты — собственные векторы ковариационной матрицы, вычисляются через SVD.
- Число компонент подбирают по доле объяснённой дисперсии (например, 95%).
- Требует предварительной стандартизации и плохо ловит нелинейную структуру.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Как считается PCA
Четыре шага от сырых данных до главных компонент.
- Центрировать данные (и обычно стандартизировать).
- Посчитать ковариационную матрицу .
- Найти её собственные векторы и значения (на практике — через SVD матрицы ).
- Отсортировать по убыванию и взять первые векторов как новый базис.
- сила регуляризации
- номер или количество: индекс шага, число соседей, кластеров или позиций
- суммирование по всем перечисленным элементам
2Границы применимости
Где PCA помогает, а где вредит.
- PCA не знает про целевую переменную: он может выбросить компоненту с малой дисперсией, но огромной предсказательной силой.
- Без стандартизации компоненты определяются признаком с самым большим масштабом.
- Компоненты — линейные комбинации всех признаков, поэтому интерпретируемость теряется.
- Нелинейную структуру (спираль, кольцо) PCA не развернёт — нужны Kernel PCA, UMAP или автоэнкодеры.
Частое полезное применение — не сжатие ради сжатия, а декорреляция и борьба с мультиколлинеарностью перед линейной моделью.
Связанные темы
Представления и снижение размерности · Линейная алгебра в ML
Eigenvalue91%
Собственное значение · Математический справочникКоэффициент растяжения вдоль направления, которое преобразование не поворачивает.
Eigenvector91%
Собственный вектор · Математический справочникНаправление, сохраняющееся при линейном преобразовании с точностью до масштаба.
Dimensionality reduction70%
Снижение размерности · ДанныеПроекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.
Dimensionality Reduction70%
Снижение размерности · Обучение без учителяКомпактное представление данных, сохраняющее важную часть структуры.
Representation Learning70%
Обучение представлений · Обучение без учителяМодель сама учится полезным признакам, чаще всего через self-supervised задачи.
Autoencoders70%
Автоэнкодеры · Глубокое обучениеСеть учится восстанавливать вход через узкое место, получая сжатое представление.
Embeddings70%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
Linear Algebra70%
Линейная алгебра · ОсновыВекторы и матрицы — способ описать данные и преобразования над ними. Обучение модели почти всегда сводится к последовательности матричных операций.
Vector70%
Вектор · Математический справочникУпорядоченный набор чисел; в ML — представление объекта в пространстве признаков.
Matrix70%
Матрица · Математический справочникПрямоугольная таблица чисел, задающая линейное преобразование или набор объектов.
Norm70%
Норма · Математический справочникМера длины вектора; выбор нормы определяет геометрию задачи.
Distance70%
Расстояние · Математический справочникМера непохожести объектов — основа кластеризации, k-NN и поиска.
Metric spaces70%
Метрические пространства · Топологический анализ данныхМножество с функцией расстояния. Любой TDA-пайплайн начинается с выбора метрики.