От ручных дескрипторов (SIFT, HOG) до эмбеддингов предобученных сетей.
Ключевые тезисы
- Классические дескрипторы устойчивы к масштабу и повороту.
- Сегодня признаки чаще берут из предпоследнего слоя предобученной сети.
- Такие эмбеддинги работают для поиска похожих изображений и кластеризации.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Ручные дескрипторы и выученные признаки
Что было до сетей и что осталось полезным сейчас.
- SIFT / ORB — ключевые точки, устойчивые к масштабу и повороту; до сих пор применяются в SLAM, склейке панорам и сопоставлении изображений.
- HOG — гистограммы направлений градиента; классика детекции пешеходов.
- Признаки из сети — активации предпоследнего слоя предобученной модели; работают как универсальный дескриптор изображения.
model = timm.create_model("resnet50", pretrained=True, num_classes=0)
model.eval()
with torch.no_grad():
emb = model(batch) # (B, 2048) — готовые признаки
emb = torch.nn.functional.normalize(emb, dim=1) # для косинусного поиска2Поиск похожих изображений
Готовый рецепт на предобученной сети.
- Прогнать все изображения через бэкбон и взять эмбеддинги.
- L2-нормализовать их — тогда скалярное произведение станет косинусом.
- Построить ANN-индекс (FAISS, HNSW).
- Для запроса посчитать эмбеддинг и найти ближайших соседей.
Признаки ImageNet-модели хорошо работают на «обычных» фотографиях. Для специфичных доменов (медицина, спутники, промышленный контроль) их лучше дообучить контрастно на своих данных.
Связанные темы
Свёртки и зрение
CNN85%
Свёрточные сети · Глубокое обучениеРазделяемые фильтры скользят по изображению, выявляя локальные паттерны с трансляционной инвариантностью.
CNN85%
Свёрточные сети в CV · Компьютерное зрениеБазовая архитектура зрения: иерархия фильтров от краёв до семантических частей объектов.
Image Classification85%
Классификация изображений · Компьютерное зрениеОтнесение всего изображения к одному или нескольким классам — базовая задача зрения.
Object Detection85%
Детекция объектов · Компьютерное зрениеПоиск объектов на изображении с указанием класса и ограничивающей рамки.
Segmentation85%
Сегментация · Компьютерное зрениеКлассификация на уровне пикселей: семантическая, инстанс- и паноптическая.
Image preprocessing85%
Предобработка изображений · Компьютерное зрениеПриведение картинок к единому формату и аугментации, расширяющие обучающую выборку.