Классическое машинное обучение

GMM

Смесь гауссиан

актуальноТекущий рабочий стандарт

Вероятностная модель: данные порождаются смесью нормальных распределений, параметры оцениваются EM-алгоритмом.

Ключевые тезисы

  • Даёт мягкое отнесение: вероятность принадлежности объекта каждому кластеру.
  • Ковариационные матрицы позволяют кластерам быть вытянутыми и повёрнутыми.
  • Число компонент выбирают по BIC/AIC; k-means — частный вырожденный случай GMM.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Смесь распределений

Мягкая кластеризация с вероятностями принадлежности.

Обозначения
  • нормальное распределение со средним μ и дисперсией σ²
  • среднее значение
  • объект: вектор признаков
  • число объектов в выборке
  • вероятность (или плотность распределения)
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • суммирование по всем перечисленным элементам

Каждый объект принадлежит всем кластерам с некоторыми вероятностями. Ковариационные матрицы позволяют кластерам быть вытянутыми и повёрнутыми — k-means этого не умеет, потому что неявно предполагает .

2

EM-алгоритм

Как обучать модель, когда метки кластеров неизвестны.

  1. E-шаг: при текущих параметрах считаем ответственности — вероятность, что объект порождён компонентой .
  2. M-шаг: при фиксированных ответственностях пересчитываем , , как взвешенные оценки.
Обозначения
  • нормальное распределение со средним μ и дисперсией σ²
  • среднее значение
  • параметр ядра RBF: радиус влияния объекта
  • объект: вектор признаков
  • число объектов в выборке
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • суммирование по всем перечисленным элементам
E-шаг: мягкое распределение объекта по компонентам
На практике

Правдоподобие не убывает на каждой итерации, но сходимость возможна в локальный максимум — поэтому запускают несколько раз с разной инициализацией. Число компонент выбирают по BIC/AIC.

Связанные темы

Кластеризация и её оценка

k-Means75%

k-средних · Классическое машинное обучение

Разбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.

DBSCAN75%

DBSCAN · Классическое машинное обучение

Плотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.

Clustering75%

Кластеризация · Обучение без учителя

Разбиение объектов на группы похожих без заранее известных меток.

Density Estimation75%

Оценка плотности · Обучение без учителя

Восстановление распределения данных: где объекты встречаются часто, а где почти никогда.

Association Rules75%

Ассоциативные правила · Обучение без учителя

Поиск закономерностей вида «если A, то B» в транзакционных данных.

Silhouette Score75%

Силуэт · Метрики

Сравнивает среднее расстояние объекта до своего кластера и до ближайшего чужого.

Davies–Bouldin75%

Индекс Дэвиса — Болдина · Метрики

Отношение внутрикластерного разброса к расстоянию между кластерами; чем меньше, тем лучше.

Calinski–Harabasz75%

Индекс Калинского — Харабаша · Метрики

Отношение межкластерной дисперсии к внутрикластерной; чем больше, тем лучше разделение.

Mapper75%

Алгоритм Mapper · Топологический анализ данных

Строит граф-скелет данных: проекция фильтрующей функцией, покрытие интервалами, локальная кластеризация и склейка.