Компьютерное зрение

Image preprocessing

Предобработка изображений

актуальноТекущий рабочий стандарт

Приведение картинок к единому формату и аугментации, расширяющие обучающую выборку.

Ключевые тезисы

  • Resize, нормализация по статистикам датасета, приведение цветовых каналов.
  • Аугментации (flip, crop, color jitter, MixUp) — самая дешёвая регуляризация в CV.
  • Аугментации применяются только к train, но должны быть согласованы с доменом.

Подробный разбор

2 подтем — раскройте любую, чтобы увидеть объяснение, формулы, примеры и интерактивные графики.

1

Приведение к единому виду

Размер, каналы, нормализация — что делают перед каждой сетью.

  • Resize / crop: сети обычно ждут фиксированный размер (224×224, 384×384). Центрированный кроп на инференсе, случайный — на обучении.
  • Каналы: OpenCV читает BGR, PyTorch ждёт RGB — классический источник тихих багов.
  • Нормализация: вычесть среднее и поделить на std, посчитанные по датасету предобучения (для ImageNet это фиксированные константы).
Обозначения
  • стандартное отклонение — разброс величины
  • среднее значение
  • объект: вектор признаков
Стандартные константы ImageNet — их же используют при дообучении
2

Аугментации

Самый дешёвый способ увеличить выборку в десятки раз.

АугментацияЧто даётКогда опасна
Горизонтальный флипинвариантность к зеркалутекст, цифры, медицина с латеральностью
Случайный кроп / масштабинвариантность к положениюесли объект мелкий и может вылететь
Цветовой джиттерустойчивость к освещениюкогда цвет — сам признак
MixUp / CutMixрегуляризация, калибровкадетекция без адаптации разметки
На практике

Аугментации применяются только к обучающей выборке. Test-time augmentation — отдельный приём: усреднение предсказаний по нескольким версиям одного изображения обычно даёт небольшой стабильный прирост.

Связанные темы

Свёртки и зрение