Разделяемые фильтры скользят по изображению, выявляя локальные паттерны с трансляционной инвариантностью.
Ключевые тезисы
- Свёртка + пулинг наращивают рецептивное поле от краёв к объектам.
- Разделение весов резко сокращает число параметров по сравнению с MLP.
- ResNet со скип-связями сделал возможным обучение сетей в сотни слоёв.
Подробный разбор
3 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Свёртка: локальность и общие веса
Почему для изображений не берут полносвязный слой.
Изображение 224×224×3 — это 150 528 входов. Полносвязный слой на 1000 нейронов потребовал бы 150 млн параметров только на первый слой. Свёрточное ядро 3×3 использует 27 весов и применяет их ко всем позициям.
- число объектов в выборке
- суммирование по всем перечисленным элементам
- Локальность: пиксель связан прежде всего с соседями.
- Разделение весов: один и тот же детектор края работает в любом месте картинки.
- Трансляционная инвариантность: сдвиг объекта не меняет ответ.
2Размеры, stride, padding, пулинг
Формула, которую полезно помнить наизусть.
- вероятность (или плотность распределения)
- номер или количество: индекс шага, число соседей, кластеров или позиций
Вход 224, ядро 3, padding 1, stride 2 → . Размер уменьшился вдвое — типичный «downsample» блок.
Рецептивное поле растёт с глубиной: два слоя 3×3 видят область 5×5, три — 7×7. Поэтому глубокая сеть из маленьких ядер эффективнее одного большого ядра и требует меньше параметров.
3Скип-связи и ResNet
Как обучили сеть из 152 слоёв.
- истинное значение целевой переменной
- объект: вектор признаков
Производная суммы даёт единичный путь для градиента: . Даже если блок «выключился», градиент проходит дальше без затухания. Именно это сделало возможным обучение очень глубоких сетей — и та же идея живёт в трансформерах.
Связанные темы
Свёртки и зрение
CNN85%
Свёрточные сети в CV · Компьютерное зрениеБазовая архитектура зрения: иерархия фильтров от краёв до семантических частей объектов.
Image Classification85%
Классификация изображений · Компьютерное зрениеОтнесение всего изображения к одному или нескольким классам — базовая задача зрения.
Object Detection85%
Детекция объектов · Компьютерное зрениеПоиск объектов на изображении с указанием класса и ограничивающей рамки.
Segmentation85%
Сегментация · Компьютерное зрениеКлассификация на уровне пикселей: семантическая, инстанс- и паноптическая.
Feature extraction85%
Извлечение признаков · Компьютерное зрениеОт ручных дескрипторов (SIFT, HOG) до эмбеддингов предобученных сетей.
Image preprocessing85%
Предобработка изображений · Компьютерное зрениеПриведение картинок к единому формату и аугментации, расширяющие обучающую выборку.