Интерпретируемость моделей

Saliency Maps and Grad-CAM

Карты значимости и Grad-CAM

актуальноТекущий рабочий стандарт

Направления: Глубокое обучение · Свёрточные сети, Доверенный ИИ · Объяснимый ИИ

Где именно на изображении модель нашла основание для своего ответа — тепловая карта поверх входа.

Обозначения
  • коэффициент, задающий вес слагаемого или скорость обновления
  • истинное значение целевой переменной
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • матрица преобразования
  • функция потерь — то, что минимизируется при обучении
  • суммирование по всем перечисленным элементам
  • частная производная — чувствительность к одному аргументу
Вес карты активаций — усреднённый класса по ней; оставляет только то, что говорит за класс

Ключевые тезисы

  • берёт целевого класса по картам последнего свёрточного слоя и взвешивает ими эти карты.
  • Карта получается грубой (размер последнего слоя), зато честно отражает то, на что реагировала сеть, а не соседний .
  • Главное применение — поиск утечки: если модель смотрит на подпись, рамку или фон, метрика на тесте ничего не значит.

Какую задачу решает

Табличную модель объясняют через : покажет, что решение определили доход и срок кредита. С изображением так не получится — признак здесь пиксель, и список важных пикселей человеку ничего не говорит. Нужен ответ в терминах картинки: куда именно смотрела сеть.

отвечает на этот вопрос, используя то, что уже есть в сети. Последний свёрточный слой хранит карты активаций — грубые по разрешению, но семантически насыщенные. логита нужного класса по этим картам показывает, насколько каждая из них важна для решения; взвешенная сумма карт даёт тепловую область, отвечающую за ответ. Метод не требует ни , ни изменения архитектуры и работает с любой свёрточной сетью.

Классическая история про волков

Классификатор «хаски против волка» показывал прекрасное качество на тесте. показали, что модель смотрит не на животное, а на снег на заднем плане: в обучающей выборке волки почти всегда были сфотографированы зимой. Ни , ни этого не показывали — метрика была честной, а ложным. Такую проверку стоит делать до релиза, а не после жалоб.

Подробный разбор

1 подтема — объяснения, формулы, примеры и интерактивные графики.

  1. Прогнать изображение вперёд и запомнить карты активаций последнего свёрточного слоя.
  2. Взять логита нужного класса по этим картам.
  3. Усреднить по пространству — получится вес важности карты для класса.
  4. Сложить карты с этими весами и оставить положительную часть: получается тепловая карта, которую растягивают до размера входа.
Обозначения
  • коэффициент, задающий вес слагаемого или скорость обновления
  • истинное значение целевой переменной
  • номер или количество: индекс шага, число соседей, кластеров или позиций
  • матрица преобразования
  • функция потерь — то, что минимизируется при обучении
  • суммирование по всем перечисленным элементам
  • частная производная — чувствительность к одному аргументу
оставляет только то, что говорит за класс; без неё карта смешивает доводы за и против
МетодРазрешениеОсобенность
грубое (размер последнего слоя)устойчив, работает для любой без
Guided пиксельноекрасиво, но слабо реагирует на смену класса
Occlusionлюбоемедленно: закрывать участки и смотреть на падение уверенности
rolloutпатчианалог для : агрегирует веса по слоям
На практике

Главная практическая польза — поиск утечки. Если модель различает классы по подписи в углу, по типу камеры или по фону палаты, тепловая карта показывает это сразу, а метрика на тесте — никогда.

Где применяется

  • Проверка перед релизомБыстрый визуальный аудит: смотрит ли модель на объект, а не на артефакт съёмки.
  • Разбор ошибокНа каждом неверном предсказании видно, что именно приняли за класса.
  • Медицинская визуализацияВрачу показывают область снимка, на которую опирается модель, — иначе ответу не доверяют.
  • Промышленный контрольПодтверждение, что детектор дефектов реагирует на дефект, а не на освещение или позицию детали.

Плюсы, минусы и альтернативы

Плюсы

  • Не требует и работает с готовой моделью.
  • Один взгляд на карту находит утечку через контекст, которую метрики не покажут никогда.
  • Понятен неспециалисту: тепловое пятно поверх картинки объяснять не нужно.
  • Есть варианты для , и .

Минусы

  • Разрешение грубое — точные границы объекта по карте не определить.
  • Показывает, куда смотрела сеть, но не почему это класса.
  • Чувствителен к выбору слоя: карта с более раннего слоя выглядит иначе.
  • Легко переоценить: похожая на разумную карта не доказывает правильность логики модели.

Брать, если

  • Модель работает с изображениями и её решения нужно объяснять или проверять.
  • Есть подозрение на утечку через фон, разметку или условия съёмки.

Не брать, если

  • Данные табличные — там работают , permutation importance и PDP.
  • Нужен количественный вклад , а не указание области.

Чем заменяют

Тема также относится к главам:Безопасность ИИАтаки

Следующий шагСобрать учебную программуПорядок изучения под роль и уровень: недели, отметка «пройдено» и повторение по расписанию.Перейти →

Глава «Интерпретируемость моделей» последний раз правилась . Нашли ошибку — напишите.