Раздел 06

Computer Vision

Компьютерное зрение

Обработка изображений, свёрточные и трансформерные архитектуры, детекция, сегментация и мультимодальные модели.

1 новинок9 актуальных1 классикаDS-направление
новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

Image preprocessingактуально

Предобработка изображений

Приведение картинок к единому формату и аугментации, расширяющие обучающую выборку.

Feature extractionклассика

Извлечение признаков

От ручных дескрипторов (SIFT, HOG) до эмбеддингов предобученных сетей.

Transfer Learningактуально

Перенос обученияиз «Глубокое обучение»

Использование модели, обученной на большой выборке, для задачи с малым числом примеров. Главный практический приём современного глубокого обучения.

Multimodal Modelsновинка

Мультимодальные модели

Единое пространство для изображений и текста — основа поиска по описанию и визуальных ассистентов.

CNNактуально

Свёрточные сети в CV

Базовая архитектура зрения: иерархия фильтров от краёв до семантических частей объектов.

Vision Transformersактуально

Vision Transformers

Изображение режется на патчи, которые обрабатываются как последовательность токенов.

CNNактуально

Свёрточные сетииз «Глубокое обучение»

Разделяемые фильтры скользят по изображению, выявляя локальные паттерны с трансляционной инвариантностью.

Image Classificationактуально

Классификация изображений

Отнесение всего изображения к одному или нескольким классам — базовая задача зрения.

Object Detectionактуально

Детекция объектов

Поиск объектов на изображении с указанием класса и ограничивающей рамки.

Segmentationактуально

Сегментация

Классификация на уровне пикселей: семантическая, инстанс- и паноптическая.

OCRактуально

Оптическое распознавание текста

Извлечение текста из изображений и сканов: детекция областей текста и его распознавание.

Object Trackingактуально

Трекинг объектов

Сопоставление детекций между кадрами: кто из объектов на новом кадре — тот же самый, что и раньше.

Pose and Keypointsактуально

Ключевые точки и поза

Определение положения суставов человека или характерных точек объекта — база для спортивной аналитики, эргономики и контроля процессов.

Kalman Filterактуально

Фильтр Калманаиз «Временные ряды»

Рекуррентная оценка скрытого состояния системы по зашумлённым наблюдениям. Оптимален для линейных систем с гауссовым шумом.

Diffusion Modelsновинка

Диффузионные моделииз «Глубокое обучение»

Модель учится обращать процесс постепенного зашумления, превращая шум в изображение за серию шагов.

Diffusionновинка

Диффузияиз «Генеративный ИИ»

Итеративное расшумление — текущий стандарт генерации изображений, видео и аудио.

GANклассика

Генеративно-состязательные сетииз «Глубокое обучение»

Генератор и дискриминатор обучаются в игре с нулевой суммой, повышая реалистичность выборок.

6 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.