Раздел 27

3D Computer Vision

Трёхмерное зрение

Снимок — это проекция: три измерения сжались в два, и глубина пропала. Трёхмерное зрение возвращает её обратно — по нескольким кадрам, по стереопаре или по одному изображению, обученной моделью. Здесь геометрия камеры, восстановление сцены и способы её представить: от облака точек до нейронного поля.

3 новинок15 актуальныхDS-направление
Что означают метки тем
новинкаНовое или быстро растущее направлениеактуальноТекущий рабочий стандартклассикаПроверено временем, но в новых проектах берут редко

Pinhole Camera Modelактуально

Модель камеры-обскуры

Простейшая модель съёмки: луч из точки сцены проходит через центр проекции и оставляет след на матрице. На ней держится вся геометрия многовидового зрения.

Homogeneous Coordinatesактуально

Однородные координаты

Приём, который делает проекцию линейной: добавляем к вектору лишнюю единицу и получаем право записывать сдвиг, поворот и деление на глубину одной матрицей.

Camera Calibrationактуально

Параметры камеры и калибровка

Внутренние параметры описывают саму камеру, внешние — где она стоит и куда смотрит. Без них пиксель невозможно превратить в луч, а луч — в точку сцены.

Rotation Representationsактуально

Представления поворота

Один и тот же поворот записывают матрицей, углами Эйлера, осью с углом или кватернионом. Выбор решает, будет ли оптимизация устойчивой и не потеряется ли степень свободы.

Homography and DLTактуально

Гомография и DLT

Проективное преобразование плоскости: восемь степеней свободы, которые связывают два вида одной плоской поверхности. Считается линейным методом по четырём соответствиям.

Matrixактуально

Матрицаиз «Математический справочник»

Прямоугольная таблица чисел, задающая линейное преобразование или набор объектов.

Eigenvectorактуально

Собственный векториз «Математический справочник»

Направление, сохраняющееся при линейном преобразовании с точностью до масштаба.

Local Features and Matchingактуально

Локальные признаки и соответствия

Чтобы связать два снимка, нужно найти на них одни и те же точки. Детектор находит выделяющиеся места, дескриптор описывает окрестность так, чтобы описание пережило поворот и смену масштаба.

Epipolar Geometryактуально

Эпиполярная геометрия

Точка на одном снимке задаёт на другом не точку, а прямую. Это сужает поиск соответствий с плоскости до линии и позволяет отбраковать ложные пары.

Fundamental and Essential Matrixактуально

Фундаментальная и существенная матрицы

Фундаментальная матрица кодирует эпиполярную геометрию в пикселях, существенная — в калиброванных лучах. Из второй извлекается взаимное положение камер.

Triangulationактуально

Триангуляция

Зная положение двух камер и пару соответствующих пикселей, восстанавливаем точку сцены: два луча в пространстве должны пересечься.

Structure from Motionактуально

Восстановление структуры по движению

По набору неупорядоченных снимков одновременно находим положения камер и трёхмерные точки сцены. Классическая основа фотограмметрии и вход почти любого 3D-пайплайна.

Bundle Adjustmentактуально

Уточнение связки

Совместная нелинейная оптимизация всех камер и всех точек по одному критерию — суммарной ошибке репроекции. Шаг, который превращает грубую реконструкцию в точную.

Pose and Keypointsактуально

Ключевые точки и позаиз «Компьютерное зрение»

Определение положения суставов человека или характерных точек объекта — база для спортивной аналитики, эргономики и контроля процессов.

Feature extractionклассика

Извлечение признаковиз «Компьютерное зрение»

От ручных дескрипторов (SIFT, HOG) до эмбеддингов предобученных сетей.

Monocular Depth Estimationновинка

Монокулярная оценка глубины

Глубина по одному снимку. Геометрически задача неразрешима — модель опирается на выученные признаки: перекрытия, размеры знакомых предметов, перспективу, размытие.

Stereo Depthактуально

Стереозрение и диспаритет

Две камеры на известном расстоянии дают глубину напрямую: чем сильнее сдвинулась точка между снимками, тем она ближе.

Segmentationактуально

Сегментацияиз «Компьютерное зрение»

Классификация на уровне пикселей: семантическая, инстанс- и паноптическая.

Neural Radiance Fieldsновинка

Нейронные поля яркости

Сцена задаётся не сеткой и не точками, а нейросетью: по координате и направлению взгляда она возвращает цвет и плотность. Картинка получается объёмным рендерингом вдоль луча.

3D Gaussian Splattingновинка

Гауссовы сплаты

Сцена — это миллионы трёхмерных гауссиан с цветом и прозрачностью. Их проекция на экран считается напрямую, поэтому рендеринг идёт в реальном времени.

Point Cloudsактуально

Облака точек

Набор трёхмерных точек без порядка и без сетки — то, что отдают лидар и SfM. Работать с ним свёрточной сетью нельзя: у данных нет регулярной решётки.

Renderingактуально

Рендеринг

Обратная зрению задача: по описанию сцены получить изображение. Понимание рендеринга нужно, чтобы обучать модели через сравнение отрисованного с настоящим.

Parametric Body Modelsактуально

Параметрические модели тела

Тело человека описывается десятком чисел формы и позой суставов. Модель превращает их в трёхмерную сетку — это резко сужает пространство поиска при восстановлении по фото.

Diffusionновинка

Диффузияиз «Генеративный ИИ»

Итеративное расшумление — текущий стандарт генерации изображений, видео и аудио.

Transformersактуально

Трансформерыиз «Глубокое обучение»

Архитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.

7 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.