← 最新论文
💬 NLP

PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

PruneGround 是一个用于 3D 视觉定位(3D Visual Grounding)的即插即用框架,它通过使用冻结的视觉语言模型来剪枝无关的空间区域、通过多视图推理重构描述,并利用空间大语言模型在缩减后的搜索空间内进行精确定位,从而提高了准确性和效率。

原作者: Duc Cao Dinh, Khai Le-Duc, Florent Draye, Chris Ngo, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Duc Cao Dinh, Khai Le-Duc, Florent Draye, Chris Ngo, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你走进一个凌乱、拥挤的客厅,有人问你:“找找门附近的红椅子。”

如果你是一个试图解决这个问题的传统计算机程序,它可能会尝试同时观察房间里的每一个物体。它会检查每一把椅子、每一张桌子、每一盏灯和每一排书架,并将每一个物体都与你的句子进行比对。在凌乱的房间里,这样做既缓慢又令人困惑,而且由于存在太多的“红椅子”或“门”,往往会导致错误。

PruneGround 是一种更像人类大脑运作的新方法。它不是观察一切,而是使用一种“智能过滤器”来忽略杂乱的信息,并只专注于重要的区域。

以下是它的工作原理,分为三个简单的步骤:

1. “聚光灯”(语言引导的空间剪枝)

把这个 3D 房间想象成一个巨大的、黑暗的舞台。当你给计算机一个像“红椅子”这样的句子时,系统并不会扫描整个舞台。相反,它使用一个**冻结的视觉-语言模型(一个能看懂也能读懂的超级智能 AI)**作为聚光灯。

这个 AI 会从不同的角度(就像监控摄像头一样)观察房间,并询问:“基于‘红椅子’和‘门’这两个词,最有可能的位置在哪里?”它会在那个特定区域画出一个框,并剪枝(切除)掉其他所有内容。突然之间,计算机不再是在看 1,000 个物体,而是在看聚光灯范围内的 10 个物体。这让这项工作变得更快,也更不容易出错。

2. “翻译官”(多视角条件的描述重构)

有时候,人类的语言是模糊的。你可能会说:“门边的椅子”,但在 3D 房间中,门可能因为被墙挡住或者看起来像墙壁而难以辨认。计算机可能会因此感到困惑。

PruneGround 的第二步就像是一个得力的翻译官。它会再次从侧面观察“聚光灯”区域。如果原始句子缺少线索(比如“这把椅子旁边还有个蓝色沙发”),AI 会注意到图片中的蓝色沙发,并将它添加到描述中

它会将你凌乱的句子改写成清晰、结构化的指令:“寻找红色的椅子。它在门附近,并且在蓝色沙发旁边。” 这为计算机提供了更多寻找正确物体的线索,即使原始句子并不完整。

3. “侦探”(LLM-Grounder)

现在,计算机已经有了一个小巧、干净的观察区域,以及一个超级清晰的指令,它会使用一个经过 3D 形状训练的大语言模型(LLM)

你可以把这个 LLM 想象成一个见过数百万个房间的侦探。它获取精炼后的线索和这个微小的区域,将文字与形状进行匹配,然后直接指向正确的物体。因为计算机只关注相关的区域,并且拥有更好的线索,所以它不会被房间里的其他椅子或桌子所干扰。

为什么这很重要?

论文声称,通过完成这三件事——剔除噪音明确线索以及使用智能侦探——PruneGround 是目前该领域表现最好的方法。

  • 它在三项主要测试(ScanRefer, Nr3D, 和 Sr3D)中都击败了以往的所有方法。
  • 它在物体众多的凌乱房间中表现尤为出色(例如有十把红椅子时),因为它通过观察该物体周围特定的“邻里环境”,准确地知道你指的是哪一把“红椅子”。

简而言之,PruneGround 并不试图一次性解决整个拼图。它先找到拼图的正确角落,理清指令,然后完美地解决那块小小的碎片。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →