Метрики

Silhouette Score

Силуэт

актуальноТекущий рабочий стандарт

Сравнивает среднее расстояние объекта до своего кластера и до ближайшего чужого.

Ключевые тезисы

  • Значения от −1 до 1; отрицательные говорят о неверном отнесении.
  • Часто используется для выбора числа кластеров.
  • Дорого считать на больших выборках — берут подвыборку.
Тема также относится к главам:Обучение без учителяКластеризация

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Как считается силуэт

Сравнение «своего» и ближайшего «чужого» кластера.

— среднее расстояние внутри своего кластера, — до ближайшего соседнего
  • — объект уверенно в своём кластере; — на границе; — вероятно, отнесён неверно.
  • Средний силуэт по выборке используют для выбора числа кластеров.
  • Сложность — на больших данных считают по подвыборке.
кластеров k3
итераций4
инерция (WCSS)0.880
Меняйте k и смотрите на инерцию: силуэт — более информативная альтернатива методу локтя
2

Как использовать на практике

Не только среднее значение.

  • Смотрите распределение силуэтов, а не только среднее: один плохой кластер может тонуть в общем числе.
  • Silhouette plot по кластерам сразу показывает, какой из них «размазан».
  • Метрика зависит от той же метрики расстояния, что и кластеризация: сравнивать разбиения с разными метриками нельзя.
кластеров k3
итераций4
инерция (WCSS)0.880
Три компактные группы: при k = 3 силуэт максимален, при k = 5 кластеры начинают дробиться

Связанные темы

Кластеризация и её оценка

k-Means75%

k-средних · Классическое машинное обучение

Разбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.

DBSCAN75%

DBSCAN · Классическое машинное обучение

Плотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.

GMM75%

Смесь гауссиан · Классическое машинное обучение

Вероятностная модель: данные порождаются смесью нормальных распределений, параметры оцениваются EM-алгоритмом.

Clustering75%

Кластеризация · Обучение без учителя

Разбиение объектов на группы похожих без заранее известных меток.

Density Estimation75%

Оценка плотности · Обучение без учителя

Восстановление распределения данных: где объекты встречаются часто, а где почти никогда.

Association Rules75%

Ассоциативные правила · Обучение без учителя

Поиск закономерностей вида «если A, то B» в транзакционных данных.

Davies–Bouldin75%

Индекс Дэвиса — Болдина · Метрики

Отношение внутрикластерного разброса к расстоянию между кластерами; чем меньше, тем лучше.

Calinski–Harabasz75%

Индекс Калинского — Харабаша · Метрики

Отношение межкластерной дисперсии к внутрикластерной; чем больше, тем лучше разделение.

Mapper75%

Алгоритм Mapper · Топологический анализ данных

Строит граф-скелет данных: проекция фильтрующей функцией, покрытие интервалами, локальная кластеризация и склейка.