← 最新论文
🤖 AI

SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images

本文介绍了 SpatialForge,这是一个可扩展的数据合成流程,能够将开放世界的二维图像转化为包含一千万对样本的数据集,从而有效启动并显著提升大型视觉 - 语言模型的三维感知空间推理能力。

原作者: Zishan Liu, Ruoxi Zang, Yanglin Zhang, Wei Liu, Yin Zhang, Jian Yao, Jiayin Zheng, Zhengzhe Liu

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Zishan Liu, Ruoxi Zang, Yanglin Zhang, Wei Liu, Yin Zhang, Jian Yao, Jiayin Zheng, Zhengzhe Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的机器人朋友,它能阅读书籍、观看图片,并准确告诉你故事中正在发生什么。它在描述事物方面表现出色:“那是一只红色的狗”,或者“沙发上有三只猫”。但如果你问它:“狗离窗户比猫更近吗?”或者“如果我站在沙发后面,猫是在我的左边还是右边?”这个机器人往往会感到困惑。它将图片视为平面绘图,而非三维世界。

本文介绍了SpatialForge,这是一种教导这些机器人理解空间、深度和透视的新方法,无需昂贵的 3D 扫描仪或特殊相机。

以下是他们解决方案的分解,采用简单的类比:

问题:“平面世界”的盲区

当前的 AI 模型就像那些只看过绘画的人。他们知道树长什么样,但无法直观地理解一棵树在另一棵树后面,或者一辆车因为看起来更小而更远

此前试图解决这一问题的方法,就像只通过观察几栋房子里的特定房间来构建整个城市的 3D 模型。他们使用了室内 3D 扫描数据(如电子游戏或机器人地图)。问题在于?这类“房间”的数量太少,不足以让 AI 了解整个世界。数据量太小且过于重复。

解决方案:"SpatialForge"(2D 到 3D 的翻译器)

作者们建立了一个巨大的自动化工厂,名为SpatialForge。他们不再等待 3D 扫描,而是从互联网上获取了1000 万张普通的 2D 照片(如街道、公园和客厅的照片),并教导 AI 如何“猜测”其中隐藏的 3D 几何结构。

可以这样理解:

  • 旧方法: 试图通过拆解车库里几辆特定的玩具车来学习汽车的工作原理。
  • SpatialForge 方法: 观察道路上数百万张真实汽车的照片,并教导 AI 仅通过 2D 图像来推断车轮、车门和引擎如何在 3D 空间中组合在一起。

工厂如何运作(流程)

该系统将这些照片通过四个步骤,就像一个由专业编辑组成的团队:

  1. 过滤器(守门人): 它剔除模糊的照片、截图或绘图。它只保留真实、清晰的现实世界照片。
  2. 侦探(预处理器): 它查看照片并说:“我看到一只狗、一个球和一棵树。”它为它们画出方框,并为每个物体写下简短描述。
  3. 几何学家(3D 猜测者):
    • 深度: 它使用一种特殊工具来猜测每个物体有多远。它学会说:“球在狗的前面,因为球遮挡了狗的一部分。”
    • 透视: 它寻找照片中的人。如果一个人正对着相机,AI 就会学会:对于这个人来说是“左”,对于相机来说就是“右”。如果这个人背对着,那么“左”就是“左”。这教导 AI 从他人的视角看世界。
  4. 教师(质量检查员): 在保存课程之前,一个超级智能的 AI 会检查工作。它会问:“学生答对了吗?”如果 AI 在猜测中犯了错,那堂课就会被丢弃。只有完美的课程才会被保留。

结果:一本巨大的教科书

这家工厂的成果是一个名为SpatialForge-10M的数据集。它包含1000 万个关于空间的问题和答案

  • 问题: “红色汽车和蓝色卡车,哪个更近?”
  • 答案: “红色汽车。”
  • 问题: “如果穿蓝衬衫的男人转过身,树是在他的左边还是右边?”
  • 答案: “他的右边。”

有效吗?

作者们使用这本新教科书训练了一个标准的 AI 模型。结果令人印象深刻:

  • AI 在判断哪些物体更近或更远方面有了很大提高。
  • 它在理解“左”和“右”方面有了很大提高,这取决于人站在哪里。
  • 它在几乎每一项测试中都取得了进步,证明你不需要昂贵的 3D 数据来教导 AI 关于 3D 空间的知识;你只需要大量经过智能处理的 2D 照片。

局限(注意事项)

作者们诚实地指出了局限性。由于他们是从 2D 照片猜测 3D,如果照片很棘手(例如镜子里的反射),AI 有时会搞错深度。它在测量确切距离(例如“汽车正好在 5 米外”)方面也不完美,但在相对关系(“汽车比树更近")方面表现非常好。

简而言之: SpatialForge 是一个巧妙的技巧,它将整个互联网的 2D 照片转化为一个 3D 教室,教导 AI 模型最终理解世界并非平面的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →