Gravity-aware partially calibrated absolute pose estimation from affine- or rotation-covariant features
本文介绍了两种高效的求解器 UP1PfAC 和 UP2PfORI,它们利用 IMU 衍生的重力向量以及来自仿射或旋转协变特征的局部几何信息,以比传统方法更少的对应点实现快速且准确的绝对位姿与焦距估计。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,仅凭一张地标照片和一张地图,试图在一座陌生而广阔的城市中寻找方向。对于计算机而言,这项任务被称为绝对位姿估计(absolute pose estimation):即根据单张图像精确确定摄像机的位置及其朝向。这种能力是现代增强现实(AR)的核心支柱,它让数字叠加层能够牢固地贴合在现实世界中,对于无人机和机器人实现无迷失导航也至关重要。多年来,这些系统一直依赖于将图像中的特定点与预建的 3D 世界模型进行匹配。然而,这个过程通常需要许多匹配点才能可靠运行,并且在摄像机的内部设置(如缩放倍率或焦距)未知时会表现挣扎。此外,传统方法往往忽略了隐藏在图像特征描述方式中的微妙几何线索,将每个点仅仅视为一个简单的点,而非具有方向和比例的形状。
来自爱立信研究中心(Ericsson Research)和萨拉戈萨大学(University of Zaragoza)的一个研究小组开发了一种新方法,通过结合视觉数据与大多数智能手机中配备的标准运动传感器信息,更高效地解决了这一问题。通过将摄像机的视野与传感器对重力的感知相结合,他们创建了一个系统,该系统可以利用比以往更少的视觉线索来确定摄像机的位置及其未知的缩放倍率。他们的工作引入了两种新方法,可以通过单张详细的图像特征,或者仅通过两个保持其方向性的特征来计算出该位置。这一突破意味着设备可以更快、更准确地实现自我定位,即使在摄像机内部设置发生变化或预先未知的情况下也是如此。
问题的核心在于计算机如何理解 3D 世界与 2D 照片之间的关系。传统上,为了确定摄像机的位置,系统需要匹配图像与 3D 地图之间的至少三个或四个点。如果摄像机的焦距也是未知的,所需点的数量会增加,这使得计算速度变慢,并且在数据存在噪声时更容易出错。研究人员意识到,他们可以通过利用两个此前未被充分利用的强大信息源来绕过这一沉重的需求。首先,他们使用了由设备的惯性测量单元(IMU)提供的重力矢量——这是一个能感知加速度和方向的小型芯片。该传感器告诉计算机哪边是“下”,从而有效地消除了关于摄像机倾斜度的两个自由度的不确定性。其次,他们挖掘了现代特征描述符中所蕴含的丰富几何数据。与其仅仅看到一个点,这些描述符还能描述一小块图像是如何拉伸或旋转的,从而提供了额外的约束,有助于用更少的样本解决这个谜题。
为了测试他们的想法,团队推导出了新的数学规则,将摄像机的位姿、未知的焦距以及重力方向联系起来。他们构建了两个特定的求解器来处理这些规则。第一个求解器被称为 UP1PfAC,它可以仅使用单个仿射对应关系(affine correspondence)来确定整个摄像机的位姿和焦凌。简单来说,这意味着它只需要一个描述图像中一小块区域如何发生变换(包括其比例和旋转)的特征。第二个求解器 UP2PfAC 则需要两个对方向敏感但未必对比例敏感的特征。在实验中,研究人员生成了数千个合成场景来测试这些新工具的稳定性。他们发现,这些求解器极其稳定,产生的误差在标准尺度上几乎微乎其微,甚至在没有添加任何噪声的情况下也是如此。当引入现实世界的误差(例如匹配点的轻微不准确或重力传感器的微小抖动)时,新方法表现优于现有的先进技术,在旧方法开始失效的地方依然保持了高精度。
真正的考验出现在研究人员将他们的求解器应用于两个著名数据集(剑桥地标集和阿亨昼夜数据集)的真实数据时。这些数据集包含了在各种相机和不同光照条件下拍摄的历史建筑和市中心图像。团队将他们的新求解器集成到一个使用鲁棒方法来过滤错误数据的标准定位流水线中。结果表明,他们的方法不仅达到了现有最佳方法的精度,而且速度显著更快。在剑桥数据集中,他们的求解器在提高旋转和焦距估计精度的同时,还缩短了寻找位置所需的时间。在更具挑战性的阿亨数据集中(包含夜间拍摄及使用不同设备的图像),他们的方法比之前的最佳半校准方法更频繁地找到正确位置。这种速度优势在处理需要更多数据点的旧算法时尤为显著,新求解器完成计算的时间仅为后者的极小部分。
这项工作证明,通过聆听特征描述符中微妙的几何低语,并结合重力传感器的稳定引导,计算机可以用更少的努力在世界中导航。研究人员发现,他们的单特征求解器非常有效,它利用仿射特征中的丰富信息作为强大的引导;而双特征求解器则为那些无法获取如此详细描述符的设备提供了一个平衡的选择。该研究证实,这些新工具不仅是理论上的改进,更是能够应对现实世界复杂情况(从噪声传感器到不完美的图像匹配)的实用解决方案。通过减少所需的样本数量并提高计算速度,这项研究为新一代低功耗、高精度定位系统铺平了道路。这对于扩展现实(XR)头显、无人机和机器人的未来至关重要,因为它们需要在瞬间明确自身位置,以便在我们的物理空间中实现无缝运行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。