← 最新论文
💻 computer science

ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space

本文介绍了 ABot-3DWorld,这是一个通用的多模态 3D 世界模型,它通过将文本、图像和视频统一为空间生成原语(Spatial Generative Primitive)、生成 3D 一致的全景视频,并将其重建为写实的 3D 高斯泼溅(Gaussian Splatting)场景,从而将文本、图像和视频转化为高保真、可探索的 3D 环境。

原作者: Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchang Zhang, Jiawei Zhang, Zhicheng Liu, Zhongxu Sun, Tianjian Ouyang, Wenzheng Chen
发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchang Zhang, Jiawei Zhang, Zhicheng Liu, Zhongxu Sun, Tianjian Ouyang, Wenzheng Chen, Shixing Yang, Nianfei Fan, Guodong Sun, Huan Li, Zheng Zhou, Yongze Li, Yingliang Peng, Mengmeng Du, Yuan Liu, Haozhe Shi, Chunnuo Gong, Chengzhen Yu, Chunxue Jia, Yang Liu, Shiying Zeng, Junnan Lai, Hang Zhang, Ning Guo, Baoquan Chen, Mu Xu, Hongyu Pan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一台神奇的相机,只需一句话、一张随手的自拍或一段手机拍摄的晃动视频,就能将其转化为一个可以自由穿行的、完整的可探索3D世界。这正是阿里巴巴高德地图(AMAP)CV实验室团队利用 ABot-3DWorld 0 实现的功能。你可以把它想象成一个现实世界的“通用翻译器”:无论你投喂的是什么——文本、单张照片或一系列视频——它都能吐出一个高清晰度、可导航的3D宇宙。

以下是这项数字魔法的工作原理,我们将通过其最酷的部分来进行拆解。

核心秘诀:“空间生成原语”(SGP)

大多数3D创作者试图像堆叠乐高积木一样,一块一块地构建世界。但这个系统使用了一个更聪明的捷径,叫做空间生成原语(Spatial Generative Primitive, SGP)。你可以把SGP想象成一个包含两样东西的“神奇快照”:

  1. 一个 360度全景图(一张环绕你四周的图片)。
  2. 一个 点云(Point Cloud),用于映射出该照片中所有物体的形状和距离。

这个小小的包裹就是世界的“DNA”。无论你是从“一间温馨的小木屋”这样的文本提示开始,还是从一段真实的街道视频开始,系统首先都会将其转化为这个SGP。如果你提供一段信息丰富的视频,系统会通过精确测量真实几何结构来构建SGP(绝非靠猜!);如果你只给它一句话,它则会发挥创意,从无到有构建出这个SGP。

旅程:规划行走路径

一旦系统拥有了SGP,它就需要研究如何进行探索。它并不仅仅是让相机在原地转圈,而是一个“智能体”(一个聪明的数字规划器)会观察点云并询问自己:“我可以在哪里行走?哪里看起来更有趣?”
它会规划一条同时实现三个目标的路径:

  • 全方位覆盖: 它确保不会错过任何角落或隐藏的门口。
  • 寻找亮点: 它能捕捉到有趣的物体(比如一个酷炫的招牌或一棵树)并放大观察。
  • 保持平稳: 它确保路径平滑,这样最终生成的视频就不会看起来抖动。

魔法表演:制作视频

现在到了重头戏。系统会根据规划好的路径,生成一段仿佛相机正沿着该路线飞行而产生的 360度全景视频

  • 问题所在: 标准的视频生成器生成的3D世界往往在单帧画面上看起来很棒,但当你移动视角时,画面就会崩塌(就像一幅平面的画,侧面看会显得很奇怪)。
  • 解决方案: 作者使用了一种名为 3D强化学习(3D Reinforcement Learning, 3DRL) 的特殊技术来训练他们的视频生成器。你可以把它想象成一个“现实检查”教练。教练会盯着视频说:“嘿,如果我这样移动相机,那栋建筑不应该像果冻一样变形。”通过这种反馈训练,系统学会了制作在几何结构上保持一致性的视频,即使在相机移动时也是如此。

最后的润色:将视频转化为世界

视频很棒,但它仍然只是一个视频。为了让它变成一个你可以飞越其中的真实3D世界,系统使用了一个名为 ABot-3DGS 的重建引擎。

  • 维修小组: 有时,生成的视频会出现模糊点或奇怪的伪影。系统会使用一个由工具(名为 FLUX)驱动的“维修小组”,它们会放大这些细节,修复瑕疵并锐化纹理。它通过两个轮次的迭代,让世界看起来清晰且真实。
  • 结果: 最终产物是一个 3D高斯泼溅(3D Gaussian Splatting, 3DGS) 世界。这是一种高级说法,指它是由数百万个微小的、彩色的、发光的点组成的云团,它们在3D空间中充当像素。你可以穿梭其中,且看起来极其逼真。

这个系统“不做”什么(以及为什么这很重要)

论文非常明确地说明了它所规避的内容。它明确拒绝仅仅将扁平图像串联起来,也拒绝使用那些忽略原始几何结构的“过度幻觉”方法。

  • 如果你给它一段真实房间的视频,它不会仅仅猜测房间背面长什么样。它使用一套严谨的几何管线,以确保3D世界与真实的观测结果相匹配。
  • 不依赖于带有路人或三脚架的、摇晃的现实世界360度相机。相反,它通过从头开始渲染完美的、干净的3D世界来构建其训练数据,因此AI是从“完美”的范例中学习,而不受现实世界相机抖动的干扰。

证据:效果有多好?

作者不仅说它看起来很酷,还进行了测量。

  • 优于竞争对手: 在针对 MarbleHY-World 2.0 等顶尖系统的测试中,当给定丰富的输入(如视频或多张照片)时,ABot-3DWorld 0 展示了更强的“场景保真度”(即看起来更像真实物体)。
  • 数据说话: 在加入3DRL“现实检查”后,系统的3D一致性显著提升。例如,衡量图像与原图接近程度的指标 PSNR34.11 跳升至 35.30;结构相似性指标 SSIM0.942 上升到了 0.951
  • 速度: 在一台配备四块高端显卡的强力计算机(4×4090)上,整个过程——从视频到最终的3D世界——大约仅需 10分钟

大局观

这不仅仅是一个玩具;它是通往一种新地图形式的桥梁。由于它是通过负责高德地图(AMAP)团队构建的,它创造出的每一个世界都可以锚定在地球上的真实位置。你可以通过一张餐厅的照片瞬间“走进”其内部,或者看着一个地标,看到一个让你窥见过去样貌的“时空传送门”。

作者认为,这种使用统一“原语”来处理从文本到视频一切内容的做法,可能是让3D内容创作变得像拍张自拍一样简单的关键,同时又能保持足以进行实际探索的准确性。这是迈向未来的一步——在未来,你只需寥寥数语或轻轻一点,即可探索任何3D空间,无论是真实的还是想象中的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →