Обучение без учителя

Dimensionality Reduction

Снижение размерности

актуальноТекущий рабочий стандарт

Компактное представление данных, сохраняющее важную часть структуры.

Ключевые тезисы

  • PCA — линейный базис, UMAP и t-SNE — нелинейная визуализация.
  • Снижение размерности часто улучшает последующую кластеризацию.
  • Помните: 2D-картинка — это проекция, а не сами данные.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

UMAP и t-SNE на практике

Как не сделать ложных выводов по красивой картинке.

  • Расстояния между кластерами на картинке не означают реальной удалённости.
  • Размеры кластеров на картинке не отражают их плотность или численность.
  • perplexity (t-SNE) и n_neighbors (UMAP) кардинально меняют результат — всегда смотрите несколько значений.
  • UMAP умеет transform для новых точек, t-SNE — нет.
На практике

Перед t-SNE и UMAP почти всегда сначала применяют PCA до 30–50 компонент: это ускоряет вычисления и снижает шум.

2

Как выбрать метод

Зависит от того, что вы собираетесь делать дальше.

ЦельМетод
Признаки для моделиPCA, автоэнкодер
Картинка для человекаUMAP, t-SNE
Борьба с мультиколлинеарностьюPCA
Нелинейное многообразиеUMAP, Isomap, автоэнкодер

Связанные темы

Плотностная кластеризация · Представления и снижение размерности

Eigenvector96%

Собственный вектор · Математический справочник

Направление, сохраняющееся при линейном преобразовании с точностью до масштаба.

HDBSCAN85%

HDBSCAN · Обучение без учителя

Иерархическая версия DBSCAN: перебирает плотности автоматически и находит кластеры разной плотности.

Spectral Clustering85%

Спектральная кластеризация · Обучение без учителя

Кластеризация через собственные векторы матрицы Лапласа графа сходства: находит невыпуклые и вложенные структуры.

DBSCAN85%

DBSCAN · Классическое машинное обучение

Плотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.

Persistent Homology85%

Персистентные гомологии · Топологический анализ данных

Центральный метод TDA: вместо одного порога ε рассматривается вся фильтрация, и отслеживается, когда топологические особенности рождаются и умирают.

PCA70%

Метод главных компонент · Классическое машинное обучение

Ортогональная проекция на направления максимальной дисперсии — линейное сжатие с минимальной потерей информации.

Dimensionality reduction70%

Снижение размерности · Данные

Проекция данных в пространство меньшей размерности с сохранением структуры — против проклятия размерности.

Representation Learning70%

Обучение представлений · Обучение без учителя

Модель сама учится полезным признакам, чаще всего через self-supervised задачи.

Autoencoders70%

Автоэнкодеры · Глубокое обучение

Сеть учится восстанавливать вход через узкое место, получая сжатое представление.

Embeddings70%

Эмбеддинги · Обработка естественного языка

Плотные векторные представления объектов, где геометрическая близость означает смысловое сходство.

Eigenvalue70%

Собственное значение · Математический справочник

Коэффициент растяжения вдоль направления, которое преобразование не поворачивает.