SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation
SPARGen 是一个统一的原生多模态生成框架,它将 3D 重建、稠密对应和空间推理集成到指令驱动的生成任务中,通过共享表示,使这些异构空间任务在执行过程中能够达到具有竞争力的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在看一张凌乱客厅的照片。在你的眼中,它只是一张由颜色和形状组成的平面图像。但对于试图理解世界的计算机来说,这张图像是一个谜题。它需要弄清楚沙发离多远,相机是在什么位置拍摄这张照片的,以及当你绕着物体走动时,物体会如何移动。这个科学领域被称为“空间感知”(spatial perception),它是让机器人能够优雅地在房间中穿行,而不是撞到墙壁的关键。长期以来,科学家们将这个谜题的不同部分视为独立的任务。一组团队构建了擅长测量距离的机器人(几何学),而另一组团队则构建了擅长回答诸如“灯左边是什么?”这类问题的模型(推理)。但就像人类的大脑并没有互不沟通的独立“距离”和“逻辑”中心一样,这些计算机模型也错失了相互学习的机会。
SPARGen 应运而生,这是一种尝试教导单个计算机模型同时完成所有任务的新方法。把它想象成一位天才艺术家,他不仅能画出一幅画,还能为画作编写故事,并计算出如果重力改变,画中的物体会如何坠落。SPARGen 并不使用不同的工具来测量深度、追踪运动或回答问题,而是使用一个统一的“大脑”,通过学习同时生成所有这些答案。它不把世界视为一系列独立任务的集合,而是将其视为一个单一且连贯的故事,其中几何与语言只是描述同一场景的不同方式。
问题所在:“专家型”瓶颈
多年来,教导计算机了解空间性的标准方法是为每一项工作雇佣一名“专家”。如果你想知道场景有多深,你就去问一个深度测量模型;如果你想知道相机在哪里,你就去问一个姿态估计模型;如果你想知道沙发后面有什么,你就去问一个语言模型。
这种方法的缺陷在于,这些专家很少互相交流。知道房间深度的模型并不一定能帮助试图回答关于房间问题的模型。这就像有一位厨师精于切菜,却从未见过制作面包的面包师;他们无法协作来烹饪出一顿完美的佳肴。此外,许多此类模型依赖于额外且笨重的插件来进行数学运算,这使得它们变得缓慢且复杂。
解决方案:“全能讲述者”
SPARGen 通过扮演一个原生多模态生成器(native multimodal generator)改变了游戏规则。它不再是专家,而是一个能流利使用两种语言的通才:图像和文本。
这里有一个神奇的技巧:SPARGen 将一切都视为一种“生成”任务。
- 针对“图像”类任务: 当它需要确定深度、点云(3D 点阵图)或光流(像素在帧间如何移动)时,它会“生成”一张新图像。它不仅仅是计算一个数字,而是绘制一幅画,通过像素的亮度来告诉你物体有多远。
- 针对“文本”类任务: 当它需要回答诸如“白色桌子右边是什么?”之类的问题时,它会像聊天机器人一样生成一段文字序列。
论文称其为**混合专家转换器(Mixture-of-Transformer-Experts, MoT)**骨干网络。想象一个巨大的图书馆,不同的“专家”(专门的 AI 大脑)居住在同一栋建筑里。一位专家擅长阅读文本,另一位擅长理解图像,还有一位擅长数学。SPARGen 让这些专家坐在同一张桌子旁进行交谈。当你提出问题时,他们都会贡献自己的知识参与对话,而不是孤立工作。
工作原理:双轨系统
SPARGen 构建在名为 Bagel 的基础之上,这是一个已经擅长理解图像和文本的模型。研究人员对其进行了升级,使其能够在不添加任何新的、奇怪的硬件或单独数学模块的情况下处理“空间”相关事务。
- 文本轨(自回归路径): 当模型需要给出结构化答案(例如相机的旋转和距离,或一段描述房间的句子)时,它会逐词(或逐标记/token)进行书写。这就像一名打字员,利用前文的语境来决定下一个字符,逐个字符地敲出句子。
- 图像轨(整流流路径): 当模型需要输出稠密图(例如每一像素的完整深度图)时,它使用了一种称为**整流流(rectified flow)**的技术。可以将这想象成雕塑家从一块噪声(静电干扰)开始,慢慢将其雕刻成清晰的形状。模型从一张模糊、随机的图像开始,在指令的引导下,“流动”成精确的深度图或点云。
这个系统的妙处在于,它不需要被告知“现在做数学”或“现在做语言”。它只需观察指令(例如“估计深度”或“右边是什么?”),便知道该使用哪条“轨道”来生成答案。
研究发现:一模胜全局
研究人员在广泛的任务上测试了 SPARGen,从测量房间深度,到计算汽车在视频中的运动,再到回答复杂的空间问题。
结果如下:
- 它是一个杂耍高手: SPARGen 仅凭一个模型就能在所有这些不同任务上表现出竞争力。它不需要单独的“深度模型”或“光流模型”。
- 击败专家: 在许多基准测试中,SPARGen 的表现与那些专为单一任务设计的模型不相上下,甚至更优。例如,在 KITTI 数据集(衡量模型追踪汽车视角运动能力的标准测试)上,SPARGen 实现了 4.09 的**终点误差(EPE)**和 13.34 的 F1-all 分数,击败了像 RAFT (5.03 EPE) 和 FlowFormer (4.10 EPE) 这样的专业化模型。
- 推理之王: 在空间推理领域(回答诸如“如果我站在这里,我的右边是什么?”之类的问题),SPARGen 碾压了竞争对手。在 SPAR 基准测试中,它的平均得分达到了 79.25,显著优于其他开源模型如 Qwen2.5-VL-72B (44.80),甚至超过了闭源巨头 GPT-4o (43.27)。
- 融合的力量: 论文指出,这些任务实际上是相辅相成的。当研究人员移除“几何”训练(即关于 3D 形状的教学)时,模型的问答能力下降了;而当移除“推理”训练时,模型对 3D 形状的理解能力也略有下降。这表明,学习以 3D 方式观察世界有助于模型理解语言,而学习语言也有助于其理解 3D 空间。
局限性:它尚未完美
尽管研究结果令人印象深刻,但作者也谨慎地指出了一项局限性。由于 SPARGen 使用 VAE(变分自编码器) 来压缩和生成图像,它必须将 3D 世界压缩进一个较小的格式中。这种压缩有时会模糊物体的锐利边缘,或者难以获得极其精确的物理测量值(例如“这张桌子距离正好是 1.23 米”)。它非常擅长理解结构和布局,但在需要毫米级精度的木匠面前,它可能不是最佳工具。
大局观
SPARGen 表明,我们不需要为每一个空间任务都构建一个不同的机器人大脑。相反,我们可以构建一个灵活的、生成式的智能大脑,让它在“想象”世界几何结构的同时,也能同时用语言进行“表达”。通过统一这些能力,该模型获得了一种更丰富、更一致的空间理解,证明了通往真正空间智能的路径,或许在于停止将数学与意义割裂开来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。