Проекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.
Ключевые тезисы
- PCA сохраняет глобальную дисперсию, t-SNE и UMAP — локальную структуру соседства.
- Визуализация в 2D помогает увидеть кластеры, но искажает расстояния.
- Автоэнкодеры дают нелинейное сжатие, обучаемое под конкретные данные.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Проклятие размерности
Почему в 500 измерениях все объекты примерно одинаково далеки друг от друга.
С ростом размерности объём пространства растёт экспоненциально, а данные остаются теми же. Расстояния между ближайшим и дальнейшим соседом сближаются, и методы на основе близости теряют смысл.
- объект: вектор признаков
- предел: к чему стремится выражение
- сходимость: выражение слева стремится к тому, что справа
- норма — длина вектора
Практическое следствие: k-NN и кластеризацию по «сырым» высокоразмерным данным обычно предваряют снижением размерности.
2Линейные и нелинейные методы
PCA сохраняет глобальную структуру, UMAP и t-SNE — локальную.
| Метод | Что сохраняет | Применение |
|---|---|---|
| PCA | глобальную дисперсию, линейные оси | предобработка, сжатие, декорреляция |
| t-SNE | локальное соседство | только визуализация |
| UMAP | локальное + частично глобальное | визуализация и признаки |
| Автоэнкодер | то, что нужно для реконструкции | нелинейное сжатие под свои данные |
t-SNE нельзя применять к новым данным (нет transform), а расстояния и размеры кластеров на его картинке не имеют смысла. Это инструмент разглядывания, а не измерения.
Связанные темы
Представления и снижение размерности
PCA70%
Метод главных компонент · Классическое машинное обучениеОртогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.
Dimensionality Reduction70%
Снижение размерности · Обучение без учителяКомпактное представление данных, сохраняющее важную часть структуры.
Representation Learning70%
Обучение представлений · Обучение без учителяМодель сама учится полезным признакам, чаще всего через self-supervised задачи.
Autoencoders70%
Автоэнкодеры · Глубокое обучениеСеть учится восстанавливать вход через узкое место, получая сжатое представление.
Embeddings70%
Эмбеддинги · Обработка естественного языкаПлотные векторные представления объектов, где геометрическая близость означает смысловое сходство.
Eigenvalue70%
Собственное значение · Математический справочникКоэффициент растяжения вдоль направления, которое преобразование не поворачивает.
Eigenvector70%
Собственный вектор · Математический справочникНаправление, сохраняющееся при линейном преобразовании с точностью до масштаба.