Классификация на уровне пикселей: семантическая, инстанс- и паноптическая.
Ключевые тезисы
- U-Net со скип-связями — стандарт в медицине и спутниковых снимках.
- Метрики: IoU (Jaccard) и Dice.
- SAM показал, что сегментация может быть промптируемой и zero-shot.
Подробный разбор
2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.
1Три вида сегментации
Семантическая, инстанс- и паноптическая.
| Тип | Что различает | Пример вопроса |
|---|---|---|
| Семантическая | классы пикселей | где на снимке дорога |
| Инстанс | отдельные объекты | сколько машин и где каждая |
| Паноптическая | и то, и другое | полная разметка сцены |
U-Net остаётся рабочей лошадкой: энкодер сжимает, декодер восстанавливает разрешение, а скип-связи возвращают потерянные детали границ. В медицине и спутниковых снимках это по-прежнему первый выбор.
2Функции потерь для сегментации
Почему кросс-энтропии часто недостаточно.
- малая величина: шум, допуск или защита от деления на ноль
- вероятность (или плотность распределения)
- функция потерь — то, что минимизируется при обучении
- суммирование по всем перечисленным элементам
- При маленьком объекте на большом фоне кросс-энтропия почти полностью определяется фоном.
- Dice loss напрямую оптимизирует перекрытие и устойчив к дисбалансу.
- На практике часто берут сумму:
BCE + Dice— так сохраняется и стабильность градиента, и фокус на объекте. - Для тонких границ добавляют boundary loss или взвешивают пиксели у краёв.
Связанные темы
Свёртки и зрение
CNN85%
Свёрточные сети · Глубокое обучениеРазделяемые фильтры скользят по изображению, выявляя локальные паттерны с трансляционной инвариантностью.
CNN85%
Свёрточные сети в CV · Компьютерное зрениеБазовая архитектура зрения: иерархия фильтров от краёв до семантических частей объектов.
Image Classification85%
Классификация изображений · Компьютерное зрениеОтнесение всего изображения к одному или нескольким классам — базовая задача зрения.
Object Detection85%
Детекция объектов · Компьютерное зрениеПоиск объектов на изображении с указанием класса и ограничивающей рамки.
Feature extraction85%
Извлечение признаков · Компьютерное зрениеОт ручных дескрипторов (SIFT, HOG) до эмбеддингов предобученных сетей.
Image preprocessing85%
Предобработка изображений · Компьютерное зрениеПриведение картинок к единому формату и аугментации, расширяющие обучающую выборку.