ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space
本文介绍了 ABot-3DWorld,这是一个通用的多模态 3D 世界模型,它通过将文本、图像和视频统一为空间生成原语(Spatial Generative Primitive)、生成 3D 一致的全景视频,并将其重建为写实的 3D 高斯泼溅(Gaussian Splatting)场景,从而将文本、图像和视频转化为高保真、可探索的 3D 环境。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一台神奇的相机,只需一句话、一张随手的自拍或一段手机拍摄的晃动视频,就能将其转化为一个可以自由穿行的、完整的可探索3D世界。这正是阿里巴巴高德地图(AMAP)CV实验室团队利用 ABot-3DWorld 0 实现的功能。你可以把它想象成一个现实世界的“通用翻译器”:无论你投喂的是什么——文本、单张照片或一系列视频——它都能吐出一个高清晰度、可导航的3D宇宙。
以下是这项数字魔法的工作原理,我们将通过其最酷的部分来进行拆解。
核心秘诀:“空间生成原语”(SGP)
大多数3D创作者试图像堆叠乐高积木一样,一块一块地构建世界。但这个系统使用了一个更聪明的捷径,叫做空间生成原语(Spatial Generative Primitive, SGP)。你可以把SGP想象成一个包含两样东西的“神奇快照”:
- 一个 360度全景图(一张环绕你四周的图片)。
- 一个 点云(Point Cloud),用于映射出该照片中所有物体的形状和距离。
这个小小的包裹就是世界的“DNA”。无论你是从“一间温馨的小木屋”这样的文本提示开始,还是从一段真实的街道视频开始,系统首先都会将其转化为这个SGP。如果你提供一段信息丰富的视频,系统会通过精确测量真实几何结构来构建SGP(绝非靠猜!);如果你只给它一句话,它则会发挥创意,从无到有构建出这个SGP。
旅程:规划行走路径
一旦系统拥有了SGP,它就需要研究如何进行探索。它并不仅仅是让相机在原地转圈,而是一个“智能体”(一个聪明的数字规划器)会观察点云并询问自己:“我可以在哪里行走?哪里看起来更有趣?”
它会规划一条同时实现三个目标的路径:
- 全方位覆盖: 它确保不会错过任何角落或隐藏的门口。
- 寻找亮点: 它能捕捉到有趣的物体(比如一个酷炫的招牌或一棵树)并放大观察。
- 保持平稳: 它确保路径平滑,这样最终生成的视频就不会看起来抖动。
魔法表演:制作视频
现在到了重头戏。系统会根据规划好的路径,生成一段仿佛相机正沿着该路线飞行而产生的 360度全景视频。
- 问题所在: 标准的视频生成器生成的3D世界往往在单帧画面上看起来很棒,但当你移动视角时,画面就会崩塌(就像一幅平面的画,侧面看会显得很奇怪)。
- 解决方案: 作者使用了一种名为 3D强化学习(3D Reinforcement Learning, 3DRL) 的特殊技术来训练他们的视频生成器。你可以把它想象成一个“现实检查”教练。教练会盯着视频说:“嘿,如果我这样移动相机,那栋建筑不应该像果冻一样变形。”通过这种反馈训练,系统学会了制作在几何结构上保持一致性的视频,即使在相机移动时也是如此。
最后的润色:将视频转化为世界
视频很棒,但它仍然只是一个视频。为了让它变成一个你可以飞越其中的真实3D世界,系统使用了一个名为 ABot-3DGS 的重建引擎。
- 维修小组: 有时,生成的视频会出现模糊点或奇怪的伪影。系统会使用一个由工具(名为 FLUX)驱动的“维修小组”,它们会放大这些细节,修复瑕疵并锐化纹理。它通过两个轮次的迭代,让世界看起来清晰且真实。
- 结果: 最终产物是一个 3D高斯泼溅(3D Gaussian Splatting, 3DGS) 世界。这是一种高级说法,指它是由数百万个微小的、彩色的、发光的点组成的云团,它们在3D空间中充当像素。你可以穿梭其中,且看起来极其逼真。
这个系统“不做”什么(以及为什么这很重要)
论文非常明确地说明了它所规避的内容。它明确拒绝仅仅将扁平图像串联起来,也拒绝使用那些忽略原始几何结构的“过度幻觉”方法。
- 如果你给它一段真实房间的视频,它不会仅仅猜测房间背面长什么样。它使用一套严谨的几何管线,以确保3D世界与真实的观测结果相匹配。
- 它不依赖于带有路人或三脚架的、摇晃的现实世界360度相机。相反,它通过从头开始渲染完美的、干净的3D世界来构建其训练数据,因此AI是从“完美”的范例中学习,而不受现实世界相机抖动的干扰。
证据:效果有多好?
作者不仅说它看起来很酷,还进行了测量。
- 优于竞争对手: 在针对 Marble 和 HY-World 2.0 等顶尖系统的测试中,当给定丰富的输入(如视频或多张照片)时,ABot-3DWorld 0 展示了更强的“场景保真度”(即看起来更像真实物体)。
- 数据说话: 在加入3DRL“现实检查”后,系统的3D一致性显著提升。例如,衡量图像与原图接近程度的指标 PSNR 从 34.11 跳升至 35.30;结构相似性指标 SSIM 从 0.942 上升到了 0.951。
- 速度: 在一台配备四块高端显卡的强力计算机(4×4090)上,整个过程——从视频到最终的3D世界——大约仅需 10分钟。
大局观
这不仅仅是一个玩具;它是通往一种新地图形式的桥梁。由于它是通过负责高德地图(AMAP)团队构建的,它创造出的每一个世界都可以锚定在地球上的真实位置。你可以通过一张餐厅的照片瞬间“走进”其内部,或者看着一个地标,看到一个让你窥见过去样貌的“时空传送门”。
作者认为,这种使用统一“原语”来处理从文本到视频一切内容的做法,可能是让3D内容创作变得像拍张自拍一样简单的关键,同时又能保持足以进行实际探索的准确性。这是迈向未来的一步——在未来,你只需寥寥数语或轻轻一点,即可探索任何3D空间,无论是真实的还是想象中的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。