3D Computer Vision
Трёхмерное зрение
Снимок — это проекция: три измерения сжались в два, и глубина пропала. Трёхмерное зрение возвращает её обратно — по нескольким кадрам, по стереопаре или по одному изображению, обученной моделью. Здесь геометрия камеры, восстановление сцены и способы её представить: от облака точек до нейронного поля.
Что означают метки тем
Pinhole Camera Modelактуально
Модель камеры-обскурыПростейшая модель съёмки: луч из точки сцены проходит через центр проекции и оставляет след на матрице. На ней держится вся геометрия многовидового зрения.
Homogeneous Coordinatesактуально
Однородные координатыПриём, который делает проекцию линейной: добавляем к вектору лишнюю единицу и получаем право записывать сдвиг, поворот и деление на глубину одной матрицей.
Camera Calibrationактуально
Параметры камеры и калибровкаВнутренние параметры описывают саму камеру, внешние — где она стоит и куда смотрит. Без них пиксель невозможно превратить в луч, а луч — в точку сцены.
Rotation Representationsактуально
Представления поворотаОдин и тот же поворот записывают матрицей, углами Эйлера, осью с углом или кватернионом. Выбор решает, будет ли оптимизация устойчивой и не потеряется ли степень свободы.
Homography and DLTактуально
Гомография и DLTПроективное преобразование плоскости: восемь степеней свободы, которые связывают два вида одной плоской поверхности. Считается линейным методом по четырём соответствиям.
Matrixактуально
Матрицаиз «Математический справочник»Прямоугольная таблица чисел, задающая линейное преобразование или набор объектов.
Eigenvectorактуально
Собственный векториз «Математический справочник»Направление, сохраняющееся при линейном преобразовании с точностью до масштаба.
Local Features and Matchingактуально
Локальные признаки и соответствияЧтобы связать два снимка, нужно найти на них одни и те же точки. Детектор находит выделяющиеся места, дескриптор описывает окрестность так, чтобы описание пережило поворот и смену масштаба.
Epipolar Geometryактуально
Эпиполярная геометрияТочка на одном снимке задаёт на другом не точку, а прямую. Это сужает поиск соответствий с плоскости до линии и позволяет отбраковать ложные пары.
Fundamental and Essential Matrixактуально
Фундаментальная и существенная матрицыФундаментальная матрица кодирует эпиполярную геометрию в пикселях, существенная — в калиброванных лучах. Из второй извлекается взаимное положение камер.
Triangulationактуально
ТриангуляцияЗная положение двух камер и пару соответствующих пикселей, восстанавливаем точку сцены: два луча в пространстве должны пересечься.
Structure from Motionактуально
Восстановление структуры по движениюПо набору неупорядоченных снимков одновременно находим положения камер и трёхмерные точки сцены. Классическая основа фотограмметрии и вход почти любого 3D-пайплайна.
Bundle Adjustmentактуально
Уточнение связкиСовместная нелинейная оптимизация всех камер и всех точек по одному критерию — суммарной ошибке репроекции. Шаг, который превращает грубую реконструкцию в точную.
Pose and Keypointsактуально
Ключевые точки и позаиз «Компьютерное зрение»Определение положения суставов человека или характерных точек объекта — база для спортивной аналитики, эргономики и контроля процессов.
Feature extractionклассика
Извлечение признаковиз «Компьютерное зрение»От ручных дескрипторов (SIFT, HOG) до эмбеддингов предобученных сетей.
Monocular Depth Estimationновинка
Монокулярная оценка глубиныГлубина по одному снимку. Геометрически задача неразрешима — модель опирается на выученные признаки: перекрытия, размеры знакомых предметов, перспективу, размытие.
Stereo Depthактуально
Стереозрение и диспаритетДве камеры на известном расстоянии дают глубину напрямую: чем сильнее сдвинулась точка между снимками, тем она ближе.
Segmentationактуально
Сегментацияиз «Компьютерное зрение»Классификация на уровне пикселей: семантическая, инстанс- и паноптическая.
Neural Radiance Fieldsновинка
Нейронные поля яркостиСцена задаётся не сеткой и не точками, а нейросетью: по координате и направлению взгляда она возвращает цвет и плотность. Картинка получается объёмным рендерингом вдоль луча.
3D Gaussian Splattingновинка
Гауссовы сплатыСцена — это миллионы трёхмерных гауссиан с цветом и прозрачностью. Их проекция на экран считается напрямую, поэтому рендеринг идёт в реальном времени.
Point Cloudsактуально
Облака точекНабор трёхмерных точек без порядка и без сетки — то, что отдают лидар и SfM. Работать с ним свёрточной сетью нельзя: у данных нет регулярной решётки.
Renderingактуально
РендерингОбратная зрению задача: по описанию сцены получить изображение. Понимание рендеринга нужно, чтобы обучать модели через сравнение отрисованного с настоящим.
Parametric Body Modelsактуально
Параметрические модели телаТело человека описывается десятком чисел формы и позой суставов. Модель превращает их в трёхмерную сетку — это резко сужает пространство поиска при восстановлении по фото.
Diffusionновинка
Диффузияиз «Генеративный ИИ»Итеративное расшумление — текущий стандарт генерации изображений, видео и аудио.
Transformersактуально
Трансформерыиз «Глубокое обучение»Архитектура целиком на внимании: параллельная обработка последовательности вместо пошаговой.
7 тем показаны здесь из других глав — они подходят по смыслу и открываются в своей главе.