← 最新论文
💻 computer science

AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models

AgentGrounder 是一个零样本三维视觉定位框架,它通过将离线对象查找表与在线、工具驱动的代理相结合,直接在彩色点云上运行,该代理选择性地检索候选对象、执行几何评分并触发按需图像渲染,从而在不依赖特定任务三维训练的情况下实现鲁棒的开放词汇定位。

原作者: Cuong Huynh, Maxim Popov, Denis Gridusov, Sergey Kolyubin

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Cuong Huynh, Maxim Popov, Denis Gridusov, Sergey Kolyubin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你身处一个巨大而杂乱的房间,里面堆满了数百件物品,但你无法一次性看清所有东西。你蒙着双眼,一位朋友给你发出语音指令:“拿起左边那把白色的小椅子。”

你的任务是在看不见房间的情况下,仅凭描述和一张心理地图找到那把特定的椅子。这本质上就是AgentGrounder为机器人所做的工作,只不过机器人面对的并非眼罩,而是“点云”(代表三维世界的数字点云)。

以下是论文如何将其解决方案拆解为简单概念的解释:

问题:“信息过载”陷阱

以往的方法试图通过向机器人展示房间里每一件物品的照片,并让一个智能 AI(“视觉 - 语言模型”)猜测用户指的是哪一件来解决这个问题。

  • 缺陷:这就像把一摞 1,000 本书递给图书管理员,让他“找出红色的那一本”,以此寻找特定的书。图书管理员会感到不知所措,浪费时间查看那些不是红色的书,并且可能因信息量过大而困惑。这会导致错误,尤其是在有许多相似物体(例如十把椅子)的情况下。

解决方案:AgentGrounder 的“智能侦探”

作者创建了一个名为AgentGrounder的新系统。与其让图书管理员淹没在书堆中,不如想象一位智能侦探,他分两个明确的阶段工作。

阶段一:“文件柜”(离线阶段)

在侦探听到请求之前,他先巡视房间并创建一个数字文件柜(称为对象查找表或 OLT)。

  • 他此时并不拍摄所有物品的照片。
  • 他只是列出一份清单:“对象 #1 是一把椅子,在角落,高 2 英尺。对象 #2 是一张桌子,在中间……"
  • 这份清单包含每个对象的 ID、名称、位置和尺寸。这是在机器人被要求执行任何任务之前一次性完成的。

阶段二:“使用工具的代理”(在线阶段)

现在,用户发出指令:“拿起左边那把白色的小椅子。”
代理不再重新查看整个房间。相反,它像一位使用特定工具集的侦探那样行动:

  1. 过滤器(检索):代理查看其文件柜并说:“好的,用户想要一把椅子。”它立即从列表中提取出椅子,忽略桌子、台灯和沙发。
  2. 尺子(几何评分):代理检查数学计算。“用户说了‘小’和‘在左边’。”它利用柜中的数据测量那些椅子的距离和尺寸。它无需看见它们就能知道哪一把最小或最靠左。
  3. 相机(按需渲染):这是巧妙之处。如果代理仍然困惑(例如:“哪一把是白色的?”),它不会拍摄整个房间的照片。它只调用相机工具来拍摄它正在辩论的特定椅子的照片。它获取刚好足够的视觉证据以做出最终决定。

为什么这种方法效果更好

论文声称这种方法在以下三个主要原因上优于其他方法,并使用了这些类比:

  • 无“级联错误”:在旧方法中,如果 AI 猜错了“锚点”对象(例如,它认为“左边”是指桌子的左边而不是房间的左边),整个逻辑链就会断裂。AgentGrounder 首先检查数学计算,因此不会陷入一连串的错误猜测中。
  • 效率:通过仅查看相关物体(椅子)且仅在绝对必要时拍照,AI 不会因无关数据而“疲劳”或困惑。这就像只阅读手册的相关页面,而不是整本书。
  • 透明度:代理的推理是清晰的。它说:“我选择这把椅子,因为它是唯一一把又小、又是白色、且在左边的。”它不只是猜测;它是经过计算的。

结果

该团队在两个著名的“数字房间”数据集(ScanRefer 和 Nr3D)上测试了这种方法。

  • 得分:AgentGrounder 显著击败了之前的最佳方法(SeeGround)。
  • 亮点:它特别擅长根据位置(如“在左边”)寻找物体,而无需先看到它们,并且比以前更好地处理了包含许多令人困惑的相似物体的房间。

局限性(潜在问题)

论文承认了两个主要缺点:

  1. 速度:拍照并让 AI 思考需要时间。这不是瞬间完成的,对于需要超快速移动的机器人来说可能是一个问题。
  2. 垃圾进,垃圾出:该系统依赖于初始的“文件柜”。如果机器人对房间的初始扫描很差(例如,它认为一把椅子是桌子),侦探就会找错地方并失败。系统无法修复错误的地图。

总结

AgentGrounder是一种让机器人在三维空间中寻找物体的新方法。它不是盲目地从数据海洋中猜测,而是先构建一个智能列表,利用数学缩小选择范围,并且仅在真正需要时才查看特定物品。这是一种更高效、更逻辑化且更准确的方式来遵循诸如“拿起右边的红色杯子”之类的指令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →