Глубокое обучение

CNN

Свёрточные сети

актуальноТекущий рабочий стандарт

Разделяемые фильтры скользят по изображению, выявляя локальные паттерны с трансляционной инвариантностью.

Ключевые тезисы

  • Свёртка + пулинг наращивают рецептивное поле от краёв к объектам.
  • Разделение весов резко сокращает число параметров по сравнению с MLP.
  • ResNet со скип-связями сделал возможным обучение сетей в сотни слоёв.
Тема также относится к главам:Компьютерное зрениеАрхитектуры

Подробный разбор

3 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Свёртка: локальность и общие веса

Почему для изображений не берут полносвязный слой.

Изображение 224×224×3 — это 150 528 входов. Полносвязный слой на 1000 нейронов потребовал бы 150 млн параметров только на первый слой. Свёрточное ядро 3×3 использует 27 весов и применяет их ко всем позициям.

Обозначения
  • число объектов в выборке
  • суммирование по всем перечисленным элементам
  • Локальность: пиксель связан прежде всего с соседями.
  • Разделение весов: один и тот же детектор края работает в любом месте картинки.
  • Трансляционная инвариантность: сдвиг объекта не меняет ответ.
2

Размеры, stride, padding, пулинг

Формула, которую полезно помнить наизусть.

Обозначения
  • вероятность (или плотность распределения)
  • номер или количество: индекс шага, число соседей, кластеров или позиций
— размер ядра, — padding, — шаг
Пример

Вход 224, ядро 3, padding 1, stride 2 → . Размер уменьшился вдвое — типичный «downsample» блок.

Рецептивное поле растёт с глубиной: два слоя 3×3 видят область 5×5, три — 7×7. Поэтому глубокая сеть из маленьких ядер эффективнее одного большого ядра и требует меньше параметров.

3

Скип-связи и ResNet

Как обучили сеть из 152 слоёв.

Обозначения
  • истинное значение целевой переменной
  • объект: вектор признаков
Блок учит не саму функцию, а поправку к тождественному отображению

Производная суммы даёт единичный путь для градиента: . Даже если блок «выключился», градиент проходит дальше без затухания. Именно это сделало возможным обучение очень глубоких сетей — и та же идея живёт в трансформерах.

Связанные темы

Свёртки и зрение