Компьютерное зрение

CNN

Свёрточные сети в CV

актуальноТекущий рабочий стандарт

Базовая архитектура зрения: иерархия фильтров от краёв до семантических частей объектов.

Ключевые тезисы

  • ResNet, EfficientNet, ConvNeXt — рабочие бэкбоны разного бюджета.
  • Transfer learning с ImageNet решает большинство задач при малых данных.
  • Свёртки дают полезный индуктивный сдвиг: локальность и трансляционная инвариантность.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Выбор бэкбона

Практическое сравнение популярных архитектур.

МодельПараметровКогда брать
ResNet-5025Mнадёжный дефолт, много готовых весов
EfficientNet-B05Mограничения по памяти и скорости
ConvNeXt29M+современный свёрточный бэкбон, качество на уровне ViT
MobileNetV35Mмобильные устройства, CPU-инференс

Transfer learning — почти всегда правильный старт: замораживаем бэкбон, обучаем голову, затем размораживаем и дообучаем всё с малым learning rate.

2

Рецептивное поле и разрешение

Почему мелкие объекты теряются и что с этим делать.

Каждый слой с пулингом или stride 2 уменьшает карту признаков вдвое. После пяти таких блоков объект размером 16 пикселей превращается в половину клетки — сеть его просто не видит.

  • FPN объединяет карты разных уровней: мелкие объекты берутся с ранних слоёв, крупные — с поздних.
  • Dilated convolution увеличивает рецептивное поле без потери разрешения.
  • Тайлинг: большие снимки режут на перекрывающиеся окна и обрабатывают по частям.

Связанные темы

Свёртки и зрение