Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control
本文介绍了 HALO,这是一种视觉运动策略,它利用从视觉-语言模型先验中蒸馏出的基于注意力的记忆检索以及稀疏注意力机制,通过减轻伪相关和误差累积,实现在部分可观测环境中的可靠长时程机器人控制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人制作一道复杂的菜肴。问题在于,厨房非常大,而机器人只能看到它眼前正在注视的东西。它无法看到整个房间,除非你给它一个特殊的“记忆”,否则它记不住五分钟前发生的事情。
这篇论文介绍了一种赋予机器人这种记忆的新方法,叫做 HALO。你可以把 HALO 想象成机器人大脑中一位聪明且组织严密的图书管理员。以下是它的工作原理,通过简单的概念进行拆解:
问题:患有失忆症的机器人
如今大多数机器人就像患有短期记忆丧失症的人。如果你对它们说“把面包放进微波炉,然后关上门”,它们可能会完成前半部分,但如果此时你关掉了灯或者把面包移出了视线,它们就会忘记自己正在做什么。
为了解决这个问题,科学家们尝试给机器人一个记录下所见所行的“笔记本”。但这种方法有两个大问题:
- “错误线索”问题: 如果机器人阅读它的整个笔记本,它可能会被无用的细节分散注意力。例如,如果机器人过去在厨房里看到了一只猫,它可能会想:“哦,猫在这里,所以我应该停止做饭!”即使这只猫与面包毫无关系。这被称为“伪相关”(spurious correlation)——机器人将两个实际上并不相关的事物联系在了一起。
- “滚雪球效应”: 如果机器人犯了一个小错误(比如抓取面包时用力过猛),这个错误会改变它接下来的观察。如果机器人一边犯错一边不断阅读整个笔记本,这些错误就会像滚下山的雪球一样堆积起来,直到机器人彻底迷失方向并导致任务失败。
解决方案:HALO(聪明的图书管理员)
作者创造了 HALO 来解决这两个问题。它使用了两个主要技巧:
技巧 1:“测验大师”(利用 AI 训练记忆)
想象一下你正在学习一门新语言。你可以只是死记硬背词典,但如果有人针对你需要知道的特定单词对你进行测试,你的学习速度会更快。
HALO 通过一个“测验大师”(一个被称为视觉语言模型的高级 AI)来实现这一点。在机器人尝试烹饪之前,测验大师会观察机器人的过往经历,并向它提问,例如:
- “柜台上原本有多少片面包?”
- “什么时候打开了炉灶?”
- “橄榄油被放在了哪里?”
机器人必须正确回答这些问题才能“通过测试”。为了回答问题,机器人必须深入挖掘它的记忆,并找到那些特定的、有用的事实。这教会了机器人的记忆系统忽略无用信息(如那只猫),转而专注于那些真正有助于烹饪的线索。
技巧 2:“聚光灯”(忽略噪音)
即使有了测验大师,阅读一段长达 8 分钟的机器人过往视频仍然会让人感到不知所措和困惑。这就像试图通过阅读书中的每一个字来在一本 500 页的书中寻找特定的句子一样。
HALO 使用了“聚光灯”技术。机器人不再阅读整本书,而是使用一种特殊的搜索工具,仅寻找过去最重要的 5 到 10 个关键句子。它忽略其他所有内容。这防止了“滚雪球效应”,因为机器人不会被旧的、嘈杂的或无关的信息搞得晕头转向。它只看当前任务所关注的特定时刻。
结果:效果如何?
研究人员在计算机模拟和实验室真实的机器人实验中测试了 HALO。他们给机器人的任务需要记住长达 8 分钟前 的事情,例如:
- 寻找之前见过但现在看不见的对象。
- 计算有多少件物品被放入了抽屉。
- 等待炉灶加热到特定时间。
研究结果如下:
- HALO 比以往的方法表现得更好。它完成任务的成功率约为 41%,而其他方法(例如仅仅阅读文本摘要的机器人,或使用人工编写规则的机器人)的成功率仅为 18% 到 29%。
- “测验大师”(VQA)帮助机器人找到了正确的线索,使成功率提升了 10%。
- “聚光灯”(Top-k attention)阻止了机器人被自己的错误所困扰,使成功率又提升了 9%。
核心结论
HALO 通过结合两件事来教会机器人如何更好地记忆:
- 提出正确的问题,以学习哪些信息才是真正重要的。
- 只看最重要的记忆,以避免被噪音淹没。
这使得机器人能够在混乱、真实的现实环境中处理长期且复杂的任务,而不会迷失方向或被自己的历史记录搞得晕头转向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。