Поиск закономерностей вида «если A, то B» в транзакционных данных.
Ключевые тезисы
- Метрики: support, confidence, lift.
- Apriori и FP-Growth — базовые алгоритмы поиска частых наборов.
- Классика анализа потребительской корзины и кросс-продаж.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Support, confidence, lift
Три числа, описывающие правило «если A, то B».
- матрица преобразования
- сходимость: выражение слева стремится к тому, что справа
Хлеб покупают в 60% чеков, молоко — в 50%, вместе — в 40%. conf(хлеб→молоко) = 0.67, lift = 0.67/0.5 = 1.33: покупка хлеба повышает шанс покупки молока на треть.
Lift = 1 означает независимость. Правило с высокой confidence, но lift около единицы бесполезно: оно просто отражает популярность товара B.
2Apriori и FP-Growth
Как искать частые наборы, не перебирая все подмножества.
Ключевое свойство антимонотонности: если набор не частый, то ни один его надмножество не может быть частым. Apriori использует это, чтобы отсекать ветви перебора. FP-Growth строит компактное дерево и обходится без генерации кандидатов — на практике заметно быстрее.
Связанные темы
Кластеризация и её оценка
k-Means75%
k-средних · Классическое машинное обучениеРазбивает объекты на k кластеров, минимизируя суммарное расстояние до центроидов.
DBSCAN75%
DBSCAN · Классическое машинное обучениеПлотностная кластеризация: кластеры — это связные области высокой плотности, остальное объявляется шумом.
GMM75%
Смесь гауссиан · Классическое машинное обучениеВероятностная модель: данные порождаются смесью нормальных распределений, параметры оцениваются EM-алгоритмом.
Clustering75%
Кластеризация · Обучение без учителяРазбиение объектов на группы похожих без заранее известных меток.
Density Estimation75%
Оценка плотности · Обучение без учителяВосстановление распределения данных: где объекты встречаются часто, а где почти никогда.
Silhouette Score75%
Силуэт · МетрикиСравнивает среднее расстояние объекта до своего кластера и до ближайшего чужого.
Davies–Bouldin75%
Индекс Дэвиса — Болдина · МетрикиОтношение внутрикластерного разброса к расстоянию между кластерами; чем меньше, тем лучше.
Calinski–Harabasz75%
Индекс Калинского — Харабаша · МетрикиОтношение межкластерной дисперсии к внутрикластерной; чем больше, тем лучше разделение.
Mapper75%
Алгоритм Mapper · Топологический анализ данныхСтроит граф-скелет данных: проекция фильтрующей функцией, покрытие интервалами, локальная кластеризация и склейка.