← 最新论文
🤖 AI

GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs

GroFT 是一个无需训练的框架,它通过利用 3D 场景图来提供确定性几何、以物体为中心的布局以及视觉属性接地,从而增强多模态大模型的空间推理能力,在无需昂贵的微调或专用编码器的情况下,在 ScanQA 和 VSI-Bench 等基准测试上实现了显著的性能提升。

原作者: Junqing Du, Fernando Ropero, Erkin Turkoz, Yanfeng Zhang, Lu Liu

发布于 2026-09-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Junqing Du, Fernando Ropero, Erkin Turkoz, Yanfeng Zhang, Lu Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类依靠直觉性的空间感来在物理世界中穿行。我们知道椅子离我们有多远,知道门是在左边还是右边,也知道房间的布局如何与外面的走廊相连。这种解释三维结构的能力,是我们与从家具到车辆的一切事物进行交互的基础。近年来,科学家们通过使用能够同时处理图像和文本的海量人工智能模型,教会了计算机如何观察和说话。这些被称为多模态大语言模型的系统,可以以令人印象深刻的流利程度描述一张图片或回答关于某个物体的问题。然而,当被要求执行需要精确空间推理的任务时——例如测量两个物体之间的距离、从单一视角理解房间的完整布局,或确定一个物体的确切大小——这些模型往往表现挣扎。它们倾向于根据训练数据中的模式进行猜测,而不是计算场景的实际几何结构,从而导致产生人类观察者一眼就能看出的错误。

华为技术有限公司的一组研究人员开发了一种新方法,旨在不重新训练人工智能模型本身的情况下解决这一差距。他们引入了一个名为 GraFT 的系统,该系统充当了计算机所见的原始视觉数据与执行任务所需的逻辑推理之间的桥梁。GraFT 并没有强迫 AI 从头学习空间规则,而是构建了一个紧凑且结构化的环境地图,即 3D 场景图。这张地图不是复杂的图像或包含数百万个点的云图,而是一个干净、有序的列表,记录了物体及其尺寸、位置以及它们相互之间的关系。一旦创建了这张地图,系统就会利用它为 AI 提供解决特定问题所需的特定证据,从而使一个冻结的、未经训练的模型能够高精度地解决困难的空间谜题。

GraFT 的核心创新在于它如何根据手头的特定任务来定制喂给 AI 的信息。研究人员发现,不同的问题需要不同类型的视觉证据。对于询问精确测量值的问题,例如桌子和沙发之间的距离,系统会完全绕过 AI 的视觉解释。相反,它使用一套符号工具,直接从 3D 场景图中存储的精确坐标中计算出答案。这确保了答案在数学上是精确的,是源自已知的场景几何结构而非猜测。对于关于整体布局的问题,例如确定一个人相对于建筑物的朝向,系统会生成一个定制的、俯视图形式的场景视图。与标准照片不同,这个视图去除了所有杂乱信息,仅将相关物体显示为具有真实比例的简单方框,使空间关系变得清晰易懂。最后,对于关于一个物体看起来是什么样的提问,系统不会向 AI 展示视频的每一帧。它利用场景的几何结构对可用的摄像角度进行排序,仅选择物体最清晰可见且居中的少数几帧,并舍弃其余部分。

研究人员在两个用于评估人工智能空间推理能力的重大基准测试中对该框架进行了测试。在一组涉及距离、大小和计数问题的测试中,该系统显著提高了标准 AI 模型的性能,某些指标的增幅接近 60%。在另一组侧重于理解房间布局及在其中导航的测试中,该系统使一个基础的、未经训练的模型不仅超越了其他通用 AI 模型,还超越了数个经过大量空间数据训练的专门模型。值得注意的是,该系统在未改变底层 AI 模型任何参数的情况下实现了这些结果;它仅仅改变了信息的呈现方式。研究人员发现,通过将正确类型的证据与正确的问题相匹配,他们可以解锁此前被认为是不具备此类任务能力的模型中所锁定的空间推理能力。

GraFT 的成功表明,当前 AI 模型的局限性可能不在于缺乏智能,而在于其接收到的数据与所提问题性质之间的不匹配。通过提供一个干净、结构化的物理世界表示,该系统允许 AI 专注于推理,而不是在解释原始、嘈杂的视觉数据中挣扎。研究人员指出,系统的准确性最终受限于初始 3D 地图的质量,但由于该地图易于维护和更新,因此该框架可以在无需昂贵重新训练的情况下扩展到新任务。这种方法为将空间理解集成到 AI 系统中提供了一条切实可行的路径,证明了只要拥有正确的工具和正确的视角,即使是冻结的模型也能学会以三维方式观察世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →