Интерпретируемость моделей

Counterfactual explanations

Контрфактические объяснения

актуальноТекущий рабочий стандарт

Минимальное изменение входа, которое меняет решение модели: «что нужно поменять, чтобы кредит одобрили».

Ключевые тезисы

  • Самая понятная форма объяснения для конечного пользователя.
  • Полезные контрфакты должны быть реалистичными и изменяемыми.
  • Прямо связаны с правом на объяснение в регуляторике.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Минимальное изменение, меняющее решение

Самая понятная форма объяснения для конечного пользователя.

Обозначения
  • объект: вектор признаков
  • функция, о которой идёт речь
  • аргумент, при котором выражение минимально (или максимально)
Пример

«Кредит одобрят, если сократить текущую задолженность на 40 000 ₽ или увеличить подтверждённый доход на 15 000 ₽/мес.» — это действие, а не отчёт о весах модели.

  • Контрфакт должен быть достижимым: нельзя предлагать уменьшить возраст.
  • И правдоподобным: комбинация признаков должна встречаться в реальных данных.
  • Полезно предлагать несколько альтернативных путей, а не один.
На практике

В регуляторике (GDPR, требования к кредитным решениям) именно такая форма ближе всего к «праву на объяснение».

2

Как их искать

Оптимизация с ограничениями на действия.

  • Задайте, какие признаки изменяемы (доход — да, возраст — нет) и в каких пределах.
  • Минимизируйте число изменённых признаков (разреженность) и величину изменения одновременно.
  • Требуйте правдоподобия: сгенерированный объект должен лежать в области реальных данных.
  • Библиотеки: DiCE, Alibi — умеют учитывать все три требования.
На практике

Контрфакты полезны и внутри команды: они показывают, какие признаки модель считает «рычагами», и часто вскрывают нелогичное поведение.

Связанные темы

Объяснение предсказаний

SHAP85%

SHAP · Интерпретируемость моделей

Распределение вклада признаков на основе значений Шепли из теории игр — с гарантиями аддитивности и согласованности.

LIME85%

LIME · Интерпретируемость моделей

Локальная аппроксимация сложной модели простой линейной в окрестности конкретного объекта.

Partial Dependence85%

Partial Dependence Plot · Интерпретируемость моделей

Показывает средний эффект признака на предсказание при усреднении по остальным признакам.

ICE85%

ICE-кривые · Интерпретируемость моделей

Individual Conditional Expectation: та же зависимость, но отдельной линией для каждого объекта.

Permutation Importance85%

Перестановочная важность · Интерпретируемость моделей

Признак перемешивается, и измеряется падение качества модели — модельно-независимый и честный подход.

Logistic Regression85%

Логистическая регрессия · Классическое машинное обучение

Линейная модель классификации: сигмоида переводит линейную комбинацию признаков в вероятность класса.