← 最新论文
💻 computer science

ORBIT++: Benchmarking SfM in the Wild with 360{\deg} Video

本文介绍了 ORBIT++,这是一个全新的运动恢复结构(SfM)基准测试,它利用在线全景 360° 视频来生成具有鲁棒真值轨迹的挑战性透视图剪辑,揭示了当前 SfM 方法在复杂现实场景中存在的显著性能差距。

原作者: Sara Sabour, Linyi Jin, Richard Tucker, Amir Hertz, Marcus Brubaker, Saurabh Saxena, Junhwa Hur, Andrea Tagliasacchi, Deqing Sun, David J. Fleet, Richard Szeliski, Noah Snavely

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Sara Sabour, Linyi Jin, Richard Tucker, Amir Hertz, Marcus Brubaker, Saurabh Saxena, Junhwa Hur, Andrea Tagliasacchi, Deqing Sun, David J. Fleet, Richard Szeliski, Noah Snavely

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

为了理解计算机是如何看待这个世界的,请想象一下,仅凭一系列二维照片来重建一个三维房间的过程。这就是被称为“运动恢复结构”(structure-from-motion)领域的根本挑战。其目标是利用一段视频(其中摄像机在空间中移动),通过数学计算精确得出摄像机在每一时刻的具体位置,同时构建出周围场景的三维模型。这项技术是增强现实应用背后的无形引擎,例如将虚拟家具放置在你的客厅中,也是引导自动驾驶车辆的地图,以及让电影制作人创造沉浸式虚拟世界的工具。多年来,研究人员一直依赖标准测试来验证他们新的计算机视觉算法是否有效。然而,这些测试通常使用简单的静态场景或计算机生成的模拟场景,无法反映现实世界中混乱、多变的状态。当摄像机快速移动、地面被雪覆盖,或者人群穿过画面时,最先进的软件往往会完全失效,无法分辨哪边是上方,也无法判断物体的距离。

来自 Google DeepMind 和多所大学的研究团队通过创建一个名为 ORBIT 的更难的新测试,解决了这一差距。他们意识到,要真正测试摄像机在野外环境中的导航能力,需要一种既具有极其丰富的视觉信息又难以处理的数据源。他们在日益增长的消费级相机拍摄的 360 度视频库中找到了这一来源。与通过狭窄窗口观察的标准视频不同,360 度摄像机会捕捉周围整个球体的影像,同时向各个方向进行观察。研究人员利用这些全景视频生成了一个专门旨在“击碎”现有技术的基准数据集。通过将这些全方位的视角裁剪成标准的窄视角片段,他们创建了数百个极具挑战性的场景,以模拟智能手机或无人机可能遇到的困难条件,如快速运动、弱光和移动人群。

构建这项测试的过程是一次严谨的验证过程。研究人员首先从互联网上收集了多样化的 3 60 度视频,内容涵盖了从划独木舟旅行、滑雪运动到繁忙旅游景点的一切场景。由于原始视频捕捉了整个球体,团队可以使用专门的计算机算法以极高的置信度计算摄像机的路径,因为即使视图的一部分模糊或在移动,球体的其他部分仍能保持清晰和稳定。他们将摄像机视为一个持有四个独立镜头的支架,从而能够从多个角度交叉检查路径,以确保数据的准确性。一旦他们获得了完整的 360 度视频可靠的“地面真值”(ground truth)路径,他们就会对视频进行数字重投影,以创建标准的透视视频。这些新片段并非随机剪辑;研究人员刻意选择了已知难度较大的视角,例如直接看向移动的水面或快速行驶的车辆,并加入了模拟的相机抖动以增加任务难度。最终结果是包含 308 个视频片段的集合,每个片段长达 30 秒,它们为计算机视觉软件提供了一个严格的障碍赛场。

当研究人员用这个新基准测试现有的最先进方法时,结果非常显著。他们评估了几种领先的算法,包括沿用多年的行业标准工具以及使用人工智能的新型学习型系统。研究结果显示,即使是最好的现有方法,在这些现实世界的条件下也会面临巨大困难。大量片段导致软件完全失效,这意味着计算机无法追踪摄像机的运动超过几秒钟。例如,依赖于寻找图像中明显特征(如建筑边缘或地面纹理)的传统方法,在面对水面或雪地等光滑表面时往往会放弃。与此同时,新型的 AI 驱动方法——旨在根据训练中学到的模式来推测 3D 结构——则经常在摄像机快速移动或以其未曾见过的路径旋转时出错。数据表明,没有任何一种方法可以应对所有挑战:有些方法擅长在人群中进行追踪,但在弱光环境下会失败;而另一些方法虽然能很好地处理快速运动,却会在缺乏纹理的环境中迷失方向。

这项研究强调,该领域已经到了进步难以衡量的程度,因为测试太简单了。研究人员发现,在他们这个新的基准测试中,每种测试的方法在至少 36% 的片段中都未能正确估计摄像机的位置。这表明,当前一代的技术尚未准备好应对最苛刻的现实应用。论文指出,缺乏可靠且困难的基准测试阻碍了该领域的发展,使得研究人员可以在完成简单任务时声称取得了成功,却忽略了复杂动态场景中发生的根本性问题。通过提供一个既多样化又经过严格验证的数据集,该团队希望为开发者提供一个明确的改进目标。这项工作并不提供解决这些问题的新方案,而是提供了一种更好的衡量方式,表明在计算机能够像人类一样可靠地在充满变数的现实世界中导航之前,还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →