Обучение без учителя

Association Rules

Ассоциативные правила

классикаНиша анализа корзины; чаще заменяется рекомендательными моделями.

Поиск закономерностей вида «если A, то B» в транзакционных данных.

Ключевые тезисы

  • Метрики: support, confidence, lift.
  • Apriori и FP-Growth — базовые алгоритмы поиска частых наборов.
  • Классика анализа потребительской корзины и кросс-продаж.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Support, confidence, lift

Три числа, описывающие правило «если A, то B».

Обозначения
  • матрица преобразования
  • сходимость: выражение слева стремится к тому, что справа
Пример

Хлеб покупают в 60% чеков, молоко — в 50%, вместе — в 40%. conf(хлеб→молоко) = 0.67, lift = 0.67/0.5 = 1.33: покупка хлеба повышает шанс покупки молока на треть.

На практике

Lift = 1 означает независимость. Правило с высокой confidence, но lift около единицы бесполезно: оно просто отражает популярность товара B.

2

Apriori и FP-Growth

Как искать частые наборы, не перебирая все подмножества.

Ключевое свойство антимонотонности: если набор не частый, то ни один его надмножество не может быть частым. Apriori использует это, чтобы отсекать ветви перебора. FP-Growth строит компактное дерево и обходится без генерации кандидатов — на практике заметно быстрее.

Связанные темы

Кластеризация и её оценка

k-Means75%

k-средних · Классическое машинное обучение

Разбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.

DBSCAN75%

DBSCAN · Классическое машинное обучение

Плотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.

GMM75%

Смесь гауссиан · Классическое машинное обучение

Вероятностная модель: данные порождаются смесью нормальных распределений, параметры оцениваются EM-алгоритмом.

Clustering75%

Кластеризация · Обучение без учителя

Разбиение объектов на группы похожих без заранее известных меток.

Density Estimation75%

Оценка плотности · Обучение без учителя

Восстановление распределения данных: где объекты встречаются часто, а где почти никогда.

Silhouette Score75%

Силуэт · Метрики

Сравнивает среднее расстояние объекта до своего кластера и до ближайшего чужого.

Davies–Bouldin75%

Индекс Дэвиса — Болдина · Метрики

Отношение внутрикластерного разброса к расстоянию между кластерами; чем меньше, тем лучше.

Calinski–Harabasz75%

Индекс Калинского — Харабаша · Метрики

Отношение межкластерной дисперсии к внутрикластерной; чем больше, тем лучше разделение.

Mapper75%

Алгоритм Mapper · Топологический анализ данных

Строит граф-скелет данных: проекция фильтрующей функцией, покрытие интервалами, локальная кластеризация и склейка.