Интерпретируемость моделей

SHAP

SHAP

актуальноТекущий рабочий стандарт

Распределение вклада признаков на основе значений Шепли из теории игр — с гарантиями аддитивности и согласованности.

Ключевые тезисы

  • Работает и локально (одно предсказание), и глобально (агрегация по выборке).
  • TreeSHAP считает точные значения для ансамблей деревьев быстро.
  • Beeswarm-график — стандартный способ показать структуру модели одним изображением.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Значения Шепли

Честное распределение «выигрыша» между признаками.

Обозначения
  • функция, о которой идёт речь
  • суммирование по всем перечисленным элементам
Средний вклад признака по всем возможным порядкам его добавления
Обозначения
  • объект: вектор признаков
  • функция, о которой идёт речь
  • суммирование по всем перечисленным элементам
Свойство аддитивности: вклады складываются точно в предсказание
  • Локально: почему конкретному клиенту отказали — по вкладу каждого признака.
  • Глобально: усреднение по выборке даёт устойчивую важность признаков.
  • TreeSHAP считает точные значения для ансамблей деревьев за полиномиальное время — поэтому SHAP так популярен именно с бустингом.
2

Как читать графики SHAP

Beeswarm, waterfall и dependence.

  • Beeswarm: каждая точка — объект; по горизонтали вклад, цвет — значение признака. Видно и силу, и направление эффекта.
  • Waterfall: разложение одного предсказания от базового значения до итогового.
  • Dependence plot: вклад признака против его значения — показывает нелинейности и взаимодействия.
На практике

При сильно коррелированных признаках SHAP тоже «размазывает» вклад между ними. Интерпретируйте группы связанных признаков вместе, а не по отдельности.

Связанные темы

Деревья и ансамбли · Объяснение предсказаний

Decision Trees85%

Решающие деревья · Классическое машинное обучение

Последовательность вопросов «признак > порог», разбивающая пространство на прямоугольные области.

Random Forest85%

Случайный лес · Классическое машинное обучение

Бэггинг деревьев со случайными подвыборками объектов и признаков: усреднение резко снижает дисперсию.

Gradient Boosting85%

Градиентный бустинг · Классическое машинное обучение

Последовательное построение деревьев, каждое из которых исправляет ошибки предыдущего ансамбля.

XGBoost85%

XGBoost · Классическое машинное обучение

Реализация бустинга с регуляризацией в функции потерь, вторым порядком оптимизации и продуманной работой с разреженностью.

LightGBM85%

LightGBM · Классическое машинное обучение

Быстрый бустинг от Microsoft: гистограммное разбиение и рост дерева по листьям вместо по уровням.

CatBoost85%

CatBoost · Классическое машинное обучение

Бустинг от Яндекса с упорядоченным кодированием категорий и упорядоченным бустингом против смещения.

Encoding85%

Кодирование категорий · Данные

Перевод категориальных признаков в числа: one-hot, ordinal, target encoding, хеширование, эмбеддинги.

LIME85%

LIME · Интерпретируемость моделей

Локальная аппроксимация сложной модели простой линейной в окрестности конкретного объекта.

Partial Dependence85%

Partial Dependence Plot · Интерпретируемость моделей

Показывает средний эффект признака на предсказание при усреднении по остальным признакам.

ICE85%

ICE-кривые · Интерпретируемость моделей

Individual Conditional Expectation: та же зависимость, но отдельной линией для каждого объекта.

Counterfactual explanations85%

Контрфактические объяснения · Интерпретируемость моделей

Минимальное изменение входа, которое меняет решение модели: «что нужно поменять, чтобы кредит одобрили».

Permutation Importance85%

Перестановочная важность · Интерпретируемость моделей

Признак перемешивается, и измеряется падение качества модели — модельно-независимый и честный подход.

Logistic Regression85%

Логистическая регрессия · Классическое машинное обучение

Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.