← 最新论文
💻 computer science

Grounded 3D-Aware Spatial Vision-Language Modeling

本文介绍了 GR3D,这是一种统一的空间视觉语言模型,它融合了显式二维定位、隐式二维定位和单目三维定位,将复杂的空间推理分解为基于定位的感知与三维推断,从而显著增强通用空间理解能力。

原作者: An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在看一张凌乱厨房的照片。你想问电脑:“左边的瓶子离右边的瓶子有多远?”或者“远处哪座建筑更高?”

大多数当前的 AI 模型就像是一个读过一百万本关于厨房的书、却从未真正“见过”厨房的人。它们可以根据训练数据中的模式来猜测答案,但经常搞错距离,或者臆造出根本不存在的物体。它们难以将你输入的词语与屏幕上的特定像素联系起来,也很难仅凭一张平面图片就判断物体的深度或距离。

现在,GR3D(基于 3D 感知的地面化视觉 - 语言模型)登场了。把 GR3D 想象成一种新型 AI 侦探,它不只是猜测;它会实际指向物体、测量它们,然后解开谜题。

以下是其工作原理,分解为三个简单的“超能力”:

1. “指指点点”的侦探(显式 2D 地面化)

想象你问 AI:“红色的椅子在哪里?”
旧模型可能只会说:“它在房间里。”
GR3D 则不同。它实际上会在屏幕上给红色椅子画一个框,并说:“我找到它了,就在这个位置。”它将你的文字转化为图像上的具体位置。这是基础:在它能测量任何东西之前,它必须确切知道你在说什么。

2. “边想边说”的助手(隐式地面化)

这是该论文最大的创新。想象你问了一个复杂的问题:“架子上的第二个瓶子离洗衣机上的泰迪熊有多远?”

普通的 AI 试图一次性回答这个问题,经常因此陷入混乱。GR3D 使用一种称为“流式区域插入”(Streaming Region Insertion)的技术。
把它想象成侦探一边和你交谈一边破案。

  • 第一步: AI 说:“首先,让我找到那个‘架子上的第二个瓶子’。”它立即找到那个瓶子,在脑海中给它画个框,并将代表该特定瓶子的一个“标记”(token,即数字标签)插入到它自己的思维过程中。
  • 第二步: 然后它说:“现在,让我找到那个‘泰迪熊’。”它找到熊,给它打上标签,并将其加入思维。
  • 第三步: 现在,既然它已经在脑海中“标记”并看到了这两个物体,它就计算它们之间的距离。

它不只是猜测答案;它是逐步构建答案,在说话的同时不断检查视觉证据。这防止了它编造事实(产生幻觉)。

3. "3D 视觉”翻译器(单目 3D 地面化)

看一张平面照片就像看城市地图;你可以看到街道,但如果没有额外线索,就无法判断建筑物有多高或有多远。这对 AI 来说很难,因为远处的小玩具车看起来和近处的大真车一样大。

GR3D 通过一种“区域提示”(Region-Prompted)方法来解决这个问题。

  • 一旦 AI 在 2D 中识别出物体(如前一步中的瓶子),它就将那个 2D 框视为向 3D 世界发出的“查询”。
  • 它使用一种称为固有归一化(Intrinsic Normalization)的特殊技巧。想象 AI 知道相机的“焦距”(镜头放大了多少)。它利用这一点在脑海中对图像进行数学上的“去缩放”,从而能够估算物体的真实尺寸和距离。
  • 然后,它输出一个带有坐标(中心、宽度、高度、深度)的 3D 框,就像视频游戏引擎那样。

为什么这很重要?

该论文声称,通过结合这三种能力,GR3D 在理解空间方面比以前的模型要好得多。

  • 更准确: 在测量 3D 物体检测(找出物体在 3D 空间中的位置)的测试中,它优于其他模型。
  • 更可靠: 因为它在回答之前会“指向”物体,所以它在物体位置方面犯的错误更少。
  • 通用性强: 它适用于室内场景(如厨房)、室外场景(如街道),甚至复杂的多视图场景(从不同角度观察场景)。

总结

GR3D 就像给 AI 戴上了一副 3D 眼镜并配了一把卷尺。它不再只是阅读房间的描述,而是学会观察图片,指向你提到的具体物品,测量它们的真实尺寸和距离,然后用它“看到”的事实来回答你的问题,而不是依靠它死记硬背的猜测。

作者在许多不同的数据集(如 Omni3D,这是一个巨大的 3D 场景集合)上测试了这一点,发现 GR3D 始终胜过其他顶级 AI 模型,证明了“地面化”(将词语与视觉现实联系起来)是让 AI 真正理解物理世界的秘诀。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →