Плотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.
Ключевые тезисы
- Параметры eps и min_samples задают, что считать плотной областью.
- Находит кластеры произвольной формы и не требует задавать их число.
- Плохо работает при сильно разной плотности кластеров — здесь помогает HDBSCAN.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Ядровые точки, границы и шум
Кластер как связная область высокой плотности.
- Ядровая точка: в её -окрестности не меньше
min_samplesобъектов. - Граничная: попадает в окрестность ядровой, но сама плотной окрестности не имеет.
- Шум: не относится ни к одному кластеру — и это полноценный результат, а не ошибка.
Кластеры получаются произвольной формы: спирали, кольца, вытянутые полосы — всё, что k-means разрезал бы поперёк.
2Подбор eps и min_samples
Два параметра, от которых зависит всё.
min_samples обычно берут около , где — размерность. Для eps строят график расстояний до -го соседа для всех точек, сортируют его и ищут «колено».
Главное ограничение DBSCAN — единая плотность для всего датасета. Если один кластер плотный, а другой разреженный, ни одно значение eps не подойдёт обоим; тогда берут HDBSCAN, который перебирает плотности иерархически.
Связанные темы
Плотностная кластеризация · Кластеризация и её оценка
HDBSCAN85%
HDBSCAN · Обучение без учителяИерархическая версия DBSCAN: перебирает плотности автоматически и находит кластеры разной плотности.
Spectral Clustering85%
Спектральная кластеризация · Обучение без учителяКластеризация через собственные векторы матрицы Лапласа графа сходства: находит невыпуклые и вложенные структуры.
Dimensionality Reduction85%
Снижение размерности · Обучение без учителяКомпактное представление данных, сохраняющее важную часть структуры.
Persistent Homology85%
Персистентные гомологии · Топологический анализ данныхЦентральный метод TDA: вместо одного порога ε рассматривается вся фильтрация, и отслеживается, когда топологические особенности рождаются и умирают.
Eigenvector85%
Собственный вектор · Математический справочникНаправление, сохраняющееся при линейном преобразовании с точностью до масштаба.
k-Means75%
k-средних · Классическое машинное обучениеРазбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.
GMM75%
Смесь гауссиан · Классическое машинное обучениеВероятностная модель: данные порождаются смесью нормальных распределений, параметры оцениваются EM-алгоритмом.
Clustering75%
Кластеризация · Обучение без учителяРазбиение объектов на группы похожих без заранее известных меток.
Density Estimation75%
Оценка плотности · Обучение без учителяВосстановление распределения данных: где объекты встречаются часто, а где почти никогда.
Association Rules75%
Ассоциативные правила · Обучение без учителяПоиск закономерностей вида «если A, то B» в транзакционных данных.
Silhouette Score75%
Силуэт · МетрикиСравнивает среднее расстояние объекта до своего кластера и до ближайшего чужого.
Davies–Bouldin75%
Индекс Дэвиса — Болдина · МетрикиОтношение внутрикластерного разброса к расстоянию между кластерами; чем меньше, тем лучше.
Calinski–Harabasz75%
Индекс Калинского — Харабаша · МетрикиОтношение межкластерной дисперсии к внутрикластерной; чем больше, тем лучше разделение.
Mapper75%
Алгоритм Mapper · Топологический анализ данныхСтроит граф-скелет данных: проекция фильтрующей функцией, покрытие интервалами, локальная кластеризация и склейка.