Camera Relocalization by Computing Pairwise Relative Poses Using Convolutional Neural Network

TL;DR

Siamese相对位姿网络在7 Scenes平均误差0.21米、9.30°,并能跨场景泛化。

cs.CV 🔴 高级 2017-07-31 15 次浏览
Zakaria Laskar Iaroslav Melekhov Surya Kalia Juho Kannala
相机重定位 Siamese CNN 相对位姿 RANSAC 室内定位

核心发现

方法论

论文提出基于ResNet34双分支Siamese CNN的相对位姿估计器。网络输入图像对,输出四元数相对旋转和三维相对平移,采用L=||Δtgt−Δt||²+β||Δrgt−Δr||²训练。测试时以512维特征做点积检索,再用前5个数据库邻居预测相对位姿;平移由两条方向射线三角化,并以RANSAC筛选,旋转则通过式ΔRj=RjᵀRq生成假设并进行共识融合。

关键结果

  • 在7 Scenes上,方法平均平移误差0.21 m、旋转误差9.30°,优于PoseNet的0.44 m、10.4°和HourglassPose的0.23 m、9.53°;在Chess、Office、Stairs等场景表现尤其突出。
  • 在统一坐标系的University数据集上,方法平均误差为1.58 m、14.02°,相较基线2.88 m、15.33°显著降低位置误差;Office从2.76 m降至0.57 m,Kitchen从1.65 m降至0.70 m。
  • 跨数据集泛化实验显示,仅用University训练、直接测试7 Scenes仍取得平均0.36 m、18.38°;这验证了相对几何关系比绝对坐标映射更具迁移性。

研究意义

研究解决了绝对位姿回归依赖场景坐标系、必须逐场景训练的长期问题。相对位姿不绑定某个世界坐标框架,因此一个网络可以服务多个相互独立的室内场景,甚至处理训练时未出现的场景。该思想连接了深度特征学习、图像检索和几何估计,为大规模机器人导航、增强现实和SLAM提供了更可扩展的路线。

技术贡献

核心贡献是把CNN从绝对位姿回归器改造成通用的成对几何关系估计器,并设计两级RANSAC融合。第一阶段利用任意两条相对平移方向进行三角化,第二阶段用其余邻居验证方向一致性;旋转则对多个相对旋转假设做共识筛选。系统无需训练深度图,也不必在测试时保留完整训练图像,只需特征检索和回归头计算。

新颖性

相较PoseNet、LSTMPose和HourglassPose直接从图像预测绝对位姿,本文据称首次以相对相机位姿作为图像重定位核心输出,并通过已知数据库位姿恢复绝对6DoF姿态。新颖性不在单一网络结构,而在“可迁移相对关系+检索+鲁棒几何融合”的完整系统设计。

局限性

  • 平移网络虽输出尺度信息,但实验中主要使用归一化方向,因此绝对位置依赖至少两幅几何上合适的数据库图像;邻居分布不佳或视线近乎平行时,三角化会不稳定。
  • 系统固定取前5个检索邻居,检索质量直接影响后续位姿;论文未系统优化检索器,也未报告大规模户外环境、严重动态遮挡或强外观变化下的结果。
  • 训练采用L2四元数与平移损失,β=1,阈值为20°;该参数化和阈值可能需要针对不同相机、尺度与场景重新调节。

未来方向

作者计划深入研究图像检索模块,并公开代码和University数据集。后续可探索学习式邻居选择、尺度恢复、多视图图优化、旋转流形损失和不确定性建模;同时应评估城市级环境、动态物体、昼夜变化及更高效的近似检索,以验证真正的大规模部署能力。

AI 总览摘要

相机重定位要回答一个看似简单却极其关键的问题:相机究竟位于环境中的哪里、朝向何方。传统SIFT、ORB与3D点云匹配在无纹理、遮挡、光照变化和重复结构中容易失效;PoseNet等CNN则直接回归绝对坐标,导致网络必须按场景训练,难以扩展到多个坐标系。

Laskar等提出一种以相对关系为核心的方案。ResNet34双分支Siamese CNN先把查询图像与数据库图像编码为512维描述子并检索最相似的5张图,再预测每一对图像之间的四元数旋转和归一化平移方向。已知数据库相机位姿后,两条方向射线通过三角化产生查询位置,RANSAC剔除不一致假设;旋转则由多个相对旋转假设进行共识融合。

在7 Scenes上,方法达到0.21 m、9.30°的平均中位误差,优于PoseNet的0.44 m、10.4°;在新建、统一坐标系的University数据集上,误差为1.58 m、14.02°,优于基线2.88 m、15.33°。仅用University训练并测试7 Scenes,仍达0.36 m、18.38°,显示其跨场景泛化能力。限制在于检索与三角化对邻居质量敏感,且实验仍集中于室内环境。

深度分析

研究背景

相机重定位服务于机器人导航、AR、SfM和SLAM。SIFT/ORB匹配、SfM加PnP-RANSAC具有几何解释性,却受纹理、光照和计算成本限制。SCoRF与可微RANSAC能从RGB-D预测场景坐标,但训练需要深度图。PoseNet、PoseNet2、HourglassPose等RGB CNN避免了深度输入,却通常学习图像到场景绝对坐标的映射。

核心问题

目标是从RGB查询图像恢复完整6DoF位姿。难点包括:数据库图像稀疏导致最近邻位置偏差;直接绝对回归依赖场景坐标系,不能自然迁移;相对平移通常缺少可靠尺度;检索错误、视线交叉不稳定和感知混淆会传播到最终估计。

核心创新

  • ��以图像对相对旋转和平移替代场景绑定的绝对回归。•用共享权重的ResNet34 Siamese分支学习可跨场景迁移的512维表示。•以数据库已知位姿将相对方向恢复为绝对位置。•提出平移三角化RANSAC与旋转共识RANSAC两级融合。•发布含Office、Meeting、Kitchen、Conference、Coffee Room五个场景且共享坐标系的University数据集,共9694张训练图和5068张测试图。

方法详解

  • ��训练:从图像对获得Δrgt、Δtgt,网络输出四元数Δr和三维Δt,优化L=||Δtgt−Δt||²+β||Δrgt−Δr||²,β=1。•表示:截断至平均池化层的ResNet34产生512维特征,点积完成检索。•检索:对每个查询选前5个数据库邻居。•相对估计:将查询与邻居特征送入共享回归头。•位置:每两条平移方向三角化,形成C(5,2)个假设,以20°角阈值RANSAC选择最多内点者。•姿态:用ΔRj=RjᵀRq得到多个Rq假设,再按角距离共识筛选,平局时采用鲁棒旋转平均。

实验设计

实验使用Microsoft 7 Scenes及新建University。指标是每场景平移和旋转误差的中位数。比较对象包括PoseNet、LSTM-Pose、VidLoc、HourglassPose、PoseNet2及逐场景训练的ResNet34-Pose基线。训练200轮,SGD批量64,初始学习率0.1,每50轮衰减10倍,权重衰减10^-5;图像随机224×224裁剪,测试用中心裁剪。

结果分析

7 Scenes平均为0.21 m、9.30°,优于PoseNet的0.44 m、10.4°、LSTM-Pose的0.31 m、9.85°和HourglassPose的0.23 m、9.53°;相较PoseNet2,方法在4个场景更优。University平均从基线2.88 m、15.33°改善至1.58 m、14.02°。跨数据集测试仍为0.36 m、18.38°,证明网络学习到一定通用几何。

应用场景

机器人可用数据库地图和相对方向快速重定位,减少逐场景训练;AR设备可在多个房间共享一个模型;移动设备可用512维描述子而非完整图像进行检索,降低内存和通信成本。实际部署仍需已标定数据库位姿、足够重叠视野及稳定的近似最近邻检索。

局限与展望

方法假设数据库位姿可靠、查询与邻居有足够视场重叠,并依赖平移射线的几何交汇。平行或错误方向会使三角化退化,错误检索也会污染RANSAC。网络虽不需深度图,却仍需离线构建数据库;前5邻居和20°阈值是经验设置。未来应联合优化检索、尺度和多视图图优化,并扩展到动态、户外和大规模时空变化环境。

通俗解读 非专业人士也能看懂

把系统想成一栋楼里的“认路员”。楼里每个已知位置都拍过照片,并在地图上做了标记。新照片进来后,认路员先从相册中找出最像的几张,而不是试图记住整栋楼的所有绝对位置。

接着,它比较新照片和每张旧照片:这两张照片之间相机大概转了多少、走向了哪里。两张旧照片像两个人从不同角度指向同一个陌生人,延长他们的指向线,就能猜出陌生人的位置。系统会尝试多组组合,并让多数意见淘汰明显不合群的答案。

方向也会这样处理:每张旧照片都给出一个“新相机应该朝哪儿”的猜测,系统选择彼此最一致的一群。这样,学习的是“两个画面之间的变化规律”,而不是某一栋楼专属的坐标表,所以换房间甚至换建筑也更容易工作。

简单解释 像给14岁少年讲一样

想象你在一个陌生学校里找教室,只拿着手机拍到的一张照片。手机先从学校相册里找出最像的几张照片,比如都拍到了同一排柜子。每张相册照片旁边都有地图位置,所以它们像是认识校园的同学。

然后,手机比较你的照片和这些旧照片,猜测“你相对那张照片往左走了多少、转了多少”。虽然单独一个猜测可能不准,但把两张旧照片的方向线交起来,就能估计你在哪里。手机还会让其他照片来投票,离群的猜测就被丢掉。

这个办法很聪明,因为它不需要死记“这栋楼的绝对坐标”。它学的是照片之间怎样变化,因此训练时没见过的新房间也可能定位。论文在7 Scenes上达到约0.21米和9.30度误差,在University上也比普通基线更好。

当然,它不是魔法:如果相册里没有相似照片,或几张照片看到的方向几乎平行,位置就难算。房间里有人挡住东西、灯光变化很大时也会变难。未来如果它能更会挑照片、处理运动物体,就更适合机器人和增强现实眼镜。

术语表

Siamese CNN(孪生卷积神经网络)

由两个共享权重的分支处理两张输入图像。它学习两幅图像之间的关系,而非只学习单幅图像的类别。

本文用ResNet34双分支提取特征并预测相对位姿。

Relative Pose(相对位姿)

描述两个相机之间旋转和平移关系的6DoF变换。平移在本文测试中主要作为方向使用。

网络直接回归四元数旋转和三维平移。

Triangulation(三角化)

利用不同观察位置发出的方向线交汇,估计目标点的位置。几何条件差时会退化。

两条数据库到查询相机的平移方向用于恢复查询位置。

RANSAC

通过随机采样和多数一致性,剔除错误观测的鲁棒估计算法。它适合含有离群值的几何问题。

论文分别用于平移假设筛选和旋转共识融合。

PoseNet

将RGB图像直接映射到绝对相机位姿的CNN方法。它通常需要按场景训练。

本文将其与PoseNet2、HourglassPose等比较。

7 Scenes / University

7 Scenes是经典七场景室内RGB-D基准;University是本文发布的五场景统一坐标系室内数据集。

两者用于精度和跨场景泛化评估。

开放问题 这项研究留下的未解疑问

  • 1 如何在检索失败、视野重叠很小或场景高度重复时保持可靠定位?当前RANSAC只能过滤不一致结果,不能创造缺失的几何信息。
  • 2 网络预测的平移尺度为何不稳定?需要结合深度、相机内参或多视图优化,建立更可靠的尺度恢复机制。
  • 3 方法在户外、动态人群、昼夜变化和城市级数据库上的计算与精度仍缺乏验证。

应用场景

近期应用

室内机器人重定位

机器人可将实时RGB图像与带位姿的地图照片检索匹配,再通过相对位姿和RANSAC恢复自身位置。前提是地图图像覆盖主要视角并已完成坐标标定,可减少每个房间单独训练模型的成本。

增强现实设备定位

AR眼镜或手机可用轻量512维特征检索相似画面,再估计6DoF姿态,实现室内导航、虚拟物体稳定叠加和跨房间体验。系统需要已建图数据库及较稳定的视觉重叠。

远期愿景

跨建筑通用定位模型

未来可训练一个面向多建筑、多相机和多季节的相对几何模型,并与神经检索和图优化结合,使机器人在未见环境中快速启动。主要障碍是动态变化、尺度一致性和大规模数据库效率。

原文摘要

We propose a new deep learning based approach for camera relocalization. Our approach localizes a given query image by using a convolutional neural network (CNN) for first retrieving similar database images and then predicting the relative pose between the query and the database images, whose poses are known. The camera location for the query image is obtained via triangulation from two relative translation estimates using a RANSAC based approach. Each relative pose estimate provides a hypothesis for the camera orientation and they are fused in a second RANSAC scheme. The neural network is trained for relative pose estimation in an end-to-end manner using training image pairs. In contrast to previous work, our approach does not require scene-specific training of the network, which improves scalability, and it can also be applied to scenes which are not available during the training of the network. As another main contribution, we release a challenging indoor localisation dataset covering 5 different scenes registered to a common coordinate frame. We evaluate our approach using both our own dataset and the standard 7 Scenes benchmark. The results show that the proposed approach generalizes well to previously unseen scenes and compares favourably to other recent CNN-based methods.

cs.CV