SFVO: Decoupled Confidence-Guided Stereo-Flow Visual Odometry with Bidirectional PnP
SFVO 是一个由对应关系驱动的立体视觉里程计框架,它利用预训练的立体匹配和光流模型来生成解耦的置信度引导几何约束,从而在不直接从图像中学习位姿的情况下,实现鲁棒的、具有度量尺度的 6-DoF 位姿估计。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机器人、自动驾驶汽车和无人机都面临着一个共同的挑战:在没有人类驾驶员的情况下,如何知道它们所处的位置以及运动方式。这项被称为“视觉里程计”(visual odometry)的任务,依赖于摄像头通过观察世界从一帧到下一帧的变化来追踪运动。几十年来,工程师们通过手动设计软件来寻找图像之间的匹配点来解决这个问题,这一过程需要巨大的精力,并且在环境变化时往往表现不佳。近年来,科学家们转向人工智能,直接从数据中学习这些模式。然而,大多数这类基于学习的系统依赖单目摄像头,这产生了一个尺度问题:计算机可以判断车辆正在移动,但如果没有额外的传感器,它很难判断车辆是在移动一米还是移动一百米。立体视觉(stereo vision)使用两个间距如人类双眼般的摄像头,通过计算深度自然地解决了这个尺度问题,但如何高效地教机器使用这种强大的配置仍然是一个难题。
一组研究人员推出了一种名为 SFVO 的新系统,填补了这一空白,使机器能够仅使用两个摄像头并结合精简的学习过程,实现高精度导航。研究人员并没有尝试教人工智能从零开始构建地图,而是将他们的系统建立在两个现有的、已经在寻找图像连接方面表现卓越的工具之上。其中一个工具经过训练,用于识别左右摄像头视图之间的深度差异;而另一个工具则经过训练,用于追踪像素在不同时刻之间的移动。这项创新的核心在于研究人员组合这些工具的方式。研究人员并没有强迫计算机直接从原始图像中猜测摄像头的方位,而是让系统利用深度和运动数据来创建一套几何规则。随后,计算机会对它看到的每一个点提出一个简单的问题:“对于旋转,我应该在多大程度上信任这个点?对于前进运动,我又该在多大程度上信任它?”
研究人员发现,场景中的所有点对于每种类型的运动而言,其用途并不完全相同。远处的点非常适合用来确定摄像头的转动,但它们往往因为距离太远,无法为相机向前行驶提供了清晰的信息。相反,近处的点对于前进运动的描述非常清晰,但在提供旋转信息方面作用较小。以往的方法通常将所有点同等对待,赋予统一的信任等级。然而,新系统将这种信任拆分为两个独立的通道。它学会了在计算转弯时对远处的点给予高置信度,而在计算前进步进时对近处的点给予高置信度。这种分离使得系统能够忽略不可靠的数据(例如会干扰计算的移动行人或车辆),同时保留场景中有用的静态部分。
为了将这些受信任的点转化为最终答案,该系统使用了一个双向工作的数学求解器。它既观察从当前帧到下一帧的运动,也观察从下一帧回到当前帧的运动,并在每一次迭代中不断优化对摄像头位置的估计。这种方法非常高效。在户外驾驶路线和室内飞行测试中,该系统表现出了极高的准确性。在针对室内无人机飞行的标准数据集测试中,它在多个测试序列中均实现了转向和前进运动的最低误差率。当在系统从未见过的地面车辆全新数据集上进行测试时,它比现有方法减少了约 60% 的总导航误差。这表明该系统不仅仅是记住了特定的道路或房间,而是学习了一种能够在不同环境和摄像头设置下通用的鲁棒运动理解方式。
这种方法的成功表明,未来机器人的导航可能并不需要从头开始构建庞大且复杂的神经网络。通过利用预训练模型来寻找图像匹配,并仅仅教导系统如何正确权衡这些信息,研究人员创造出了一种既强大又实用的方法。该系统运行速度极快,足以在标准硬件上运行,处理视频仅需不到一秒的时间,这对于实时导航至关重要。它避免了对昂贵惯性传感器或复杂后端优化的需求,而是依靠两个摄像头提供的几何清晰度以及一种智能的噪声过滤方式。这项工作为提高自主机器的可靠性提供了一条清晰的路径,它表明,有时解决复杂问题最有效的方法是让专业工具发挥其长处,然后仅仅教会系统如何去倾听它们。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。