← 最新论文
💻 computer science

WorldRover: A Scalable Synthetic Video Data Engine for World Exploration with Rich Annotations

本文介绍了 WorldRover,这是一个基于虚幻引擎(Unreal Engine)构建的可扩展数据引擎,能够生成由艺术家构建的环境所组成的、具有丰富标注的长距离合成视频序列,为训练用于连贯世界探索与重建的模型提供同步的 RGB、度量深度、相机轨迹以及多样化的视角数据。

原作者: Xiaojie Xu, Zhengyuan Lin, Runyi Li, Yihao Liu, Kaipeng Zhang, Yongtao Ge

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaojie Xu, Zhengyuan Lin, Runyi Li, Yihao Liu, Kaipeng Zhang, Yongtao Ge

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

要理解机器如何学习在世界中导航,我们必须首先理解什么是“看见”那个世界。对于计算机而言,要在空间中移动,仅仅拥有前方景象的照片是不够的。它需要知道物体有多远,相机本身是如何移动的,以及当物体相互遮挡时,其形状是如何变化的。在现实世界中,同时捕捉所有这些信息是极其困难的。相机可以记录视频,但它无法自动告诉你距离一棵树的确切距离,也无法告诉你拿着相机的人走过的精确路径。科学家们通常不得不事后去猜测这些细节,而这些猜测可能会出错,尤其是在物体互相遮挡视线的时候。如果没有完美的几何结构和运动知识,很难教会计算机构建一个稳定、连贯的心理地图,以便它能够探索并返回某个地方。

这正是来自东京大学 Alaya 实验室和上海创新研究院的研究团队所解决的挑战,他们开发了一个名为 WorldRover 的新系统。他们并没有试图从混乱的现实视频中提取完美的数据,而是构建了一个从零开始生成数据的机器。他们创建了一个流水线,将艺术家构建的虚拟环境输入其中,并让相机在其中进行长达分钟级的旅程。其核心创新在于,该系统不仅记录视频,还同时记录了整个旅程的历史。随着相机的移动,系统会捕捉它所经过的精确路径、到场景中每个点的精确距离,以及图像中的每个像素与前一时刻像素之间的关系。因为这个世界是合成的,研究人员掌握着每一帧的真相:他们确切知道相机在哪里,光线是如何照射在墙上的,以及每个物体在三维空间中的位置。

这一努力的结果是一个名为 WorldRover-10M 的海量数据集。它包含来自 32 个不同虚拟环境的 6000 多个不同视频序列,涵盖了从城市街道、地铁站到森林和教堂的各种场景。总计,该数据集持有超过 2100 万帧视频,相当于超过 200 小时的时长。使这一收藏如此独特的原因在于,它提供了同一段旅程的三种不同视角:如同在世界中行走的一人称视角、从背后跟随角色的第三人称视角,以及捕捉观察者周围一切的 360 度全景视角。对于每一帧,系统都提供了一套匹配的标签。这些标签包括场景精确深度的地图、相机移动的记录,以及图像中点位随时间变化的密集追踪。

研究人员设计这个引擎是为了解决一个特定的问题:即需要一种视觉变化的原因永远不会被混淆的数据。在普通视频中,很难判断一个像素的移动是因为物体在动,还是因为相机在转动。在 WorldRover 中,研究人员可以根据不同的条件重放完全相同的路线。他们可以让同一段穿行于城市的步行过程出现在明亮的日光下,随后是在浓雾中,甚至是在一个移除了所有纹理但保留了形状的纯净白模模型中。由于路径和几何结构保持一致,而只有外观发生了变化,因此通过这些数据学习的计算机可以学会将世界的结构与它的外观区分开来。这种分离对于训练那些需要深度理解世界以进行导航或进行三维重建的模型至关重要。

为了实现这一点,团队使用了一个强大的游戏引擎——这是一种通常用于创建电子游戏的工具,但他们将其重新用于科学数据生成。他们准备了 32 个由艺术家创作的独特环境,确保这些环境像真实场所一样充满细节和杂物。然后,他们编写了三种不同的移动方式。第一种方法使用预先计算好的可通行路径图来规划高效路线;第二种方法使用一个反应式智能体,它在移动时会感知障碍物,有时会徘徊或被卡住,就像人在探索一个新房间一样;第三种方法则允许人类手动记录路径。这些路径随后进行离线渲染,这意味着计算机会花时间精确计算每一条光线和阴影,而不是为了追求实时图像而匆忙处理。这个过程使他们能够生成物理上准确的数据,其光照会随着时间或天气的变化而正确改变。

该数据集包含针对不同任务定制的特定子集。第三人称序列特别有价值,因为它们展示了角色独立于相机移动的过程。这使得研究人员可以研究机器如何区分观察者的运动与世界中物体的运动。系统还会对角色和背景上的点进行长时间的追踪,即使这些点被墙壁或其他物体遮挡。数据不仅告诉计算机一个点在可见时的位置,还告诉它如果该点仍然可见,它会在哪里,这是一个被称为“非显性追踪”(amodal tracking)的概念。这对于理解“一辆在建筑物后方的汽车即便看不见,依然存在且具有特定位置”这一概念至关重要。

WorldRover-10M 不仅仅是一个视频集合,它是一个结构化的库,其中每一项信息都与捕捉它的精确时刻相绑定。深度图以米为单位进行测量,光流记录了像素移动的精确单位,相机路径也以高保真度进行了记录。团队以一种允许研究人员轻松访问原始信息而无需进行猜测或估算的格式发布了这些数据。他们已向公众开放了这些数据,为他人构建能够理解、导航和重建可探索世界的模型提供了基础。通过将世界探索问题转化为可扩展的数据生成任务,研究人员为人工智能领域提供了一个新工具,它提供了一种在仅靠现实世界录像时无法实现的清晰度和控制力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →