← 最新论文
💻 computer science

Grounding by Remembering: Cross-Scene and In-Scene Memory for 3D Functional Affordances

本文介绍了AFFORDMEM,这是一个无需训练的框架,它通过利用标注示例的跨场景记忆引导视觉语言模型聚焦细粒度区域,并借助场景内空间记忆解决复杂关系查询,从而在不进行模型微调的情况下在SceneFun3D基准测试中实现了最先进水平。

原作者: Qirui Wang, Jingyi He, Yining Pan, Xulei Yang, Shijie Li

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Qirui Wang, Jingyi He, Yining Pan, Xulei Yang, Shijie Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人整理杂乱的房间。你给它一个简单的指令:“关上从上面数第二个抽屉。”

对人类来说,这很容易。我们知道抽屉是什么,知道把手长什么样,并且可以数数来找到正确的那个。但对于由当前人工智能驱动的机器人来说,这却是一场噩梦。机器人可能会因为两个主要原因而感到困惑:

  1. “缩放”问题:机器人看到了整个抽屉,却不知道确切应该抓取哪个微小部分。它可能会试图抓取整个木制抽屉面板,而不是那个小小的金属把手。
  2. “哪一个”问题:如果有三个相同的抽屉,机器人就会迷失方向。它不知道哪一个是“从上面数第二个”,因为它无法同时看到整个房间;它一次只能看到一个角度。

这篇论文介绍了一个名为AFFORDMEM的新系统来解决这些问题。与其试图从头开始教机器人新技能(这需要大量时间和数据),AFFORDMEM 赋予机器人一本记忆书和一张心理地图

以下是其工作原理,使用简单的类比:

1. “记忆书”(跨场景功能记忆)

问题:当机器人看到门把手时,它不知道是应该抓整个门还是只抓把手。这就像一个从未开过门的儿童;他们可能会试图推整面墙。

解决方案:机器人拥有一本记忆书,里面装满了它以前“见过”的成千上万个房间中的把手、旋钮和按钮的图片。

  • 如何帮助:当机器人看到一个新把手时,它会翻阅记忆书。它会找到一张相似把手的图片,并看到明亮的红色高亮显示,指示人类确切会抓握的位置。
  • 类比:这就像老师在学生尝试写字之前,给他们看一张“正确握笔姿势”的照片。机器人不需要从头开始学习把手是什么;它只需回忆:“哦,我以前见过这个!人类会抓这里。”

2. “心理地图”(场景内空间记忆)

问题:机器人正看着一个抽屉。它不知道上面还有另外两个抽屉。如果它看不到整个堆叠,就无法数出“从上面数第二个”。

解决方案:当机器人在房间里移动时,它会构建一张3D 心理地图(就像游戏地图或蓝图)。它不仅仅存储图片;它还存储它找到的每一个把手的位置

  • 如何帮助:当你说“从上面数第二个”时,机器人会查看它的心理地图。它看到所有三个把手垂直排列。它在地图上数一数,然后说:“啊,这个特定坐标上的那个是第二个。”
  • 类比:想象你在一个有三个相同电灯的黑暗房间里。你无法同时看到它们。但如果你脑海中有一张房间的蓝图,即使你此刻正看着装有第一个开关的墙,你也确切知道第二个开关相对于第一个开关的确切位置。

结果

通过结合这两种工具:

  1. 记忆书告诉机器人抓什么(小小的把手,而不是整扇门)。
  2. 心理地图告诉机器人抓哪一个(第二个,而不是第一个)。

该论文在名为SceneFun3D的数据集上对此进行了测试,该数据集是一组真实的 3D 房间扫描数据。结果表明,这种基于“记忆”的方法比之前未使用这些记忆技巧的方法效果显著更好。

至关重要的是,论文强调该系统是“无需训练的”。

  • 它不需要在新房间上进行重新训练。
  • 它不需要人类在新房间上画线来教导它。
  • 它只是利用从旧数据构建的“记忆书”和观察新房间时构建的“心理地图”来即时解决问题。

简而言之,AFFORDMEM 通过赋予机器人过往经验的图书馆当前房间的地图,使机器人更擅长遵循指令,让它们无需人类手把手指导就能找到确切需要触摸的正确物体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →