想象一下你正在尝试烹饪一道复杂的菜肴,但每次你转头去拿调料时,你都会瞬间忘记刚才在做什么。你可能会打开炉灶,然后走开去拿锅,接着就忘了把它关掉,或者更糟,忘了你已经放了盐。这就是许多现有机器人面临的问题:它们在观察眼前事物方面极其聪明,但几乎没有“短期记忆”——它们几乎记不起几秒钟或几分钟前发生了什么。
这篇论文介绍了一种名为 PRISM 的新机器人大脑和一个名为 REMEMBENCH 的新测试,旨在解决这个问题。以下是其工作原理的简单解释:
问题所在:拥有“金鱼记忆”的机器人
大多数现代机器人通过观察人类完成任务来学习(就像学生模仿老师)。然而,它们通常只关注当前的视频帧。如果一个任务需要记住 30 秒前发生的事情——比如“我打开了炉灶,所以我需要在 2 分钟后把它关掉”——机器人就会失败,因为它没有关于过去动作的记忆。
如果你试图通过给机器人提供更长的视频历史记录来修复这个问题,会出现两个坏处:
- 噪声问题: 机器人会被过多的信息淹没。它可能会开始将随机、无用的细节(比如背景中的干扰物)与决策联系起来,从而导致错误。
- 重体力活问题: 处理长段视频历史需要巨大的计算能力和内存,这会让机器人的运行变得缓慢且昂贵。
解决方案:PRISM(聪明的图书管理员)
作者构建了 PRISM,这是一个机器人策略,它的角色更像是一个聪明的图书管理员,而不是一个囤积者。它不会把书的每一页都刻在脑子里,而是使用了两个巧妙的技巧:
“门控注意力”过滤器(保镖):
想象机器人的记忆是一个拥挤的房间。PRISM 有一个站在门口的保镖,决定谁可以留下,谁该被踢出去。如果机器人记得“我拿起了一个红苹果”,但当前的任务是关于一个蓝碗,保镖就会拦截掉红苹果的记忆,以免它干扰机器人。这防止了机器人将无关的过去事件与当前的动作建立错误的联系。
“层级式”总结器(新闻主播):
PRISM 不会阅读长篇历史中的每一个字,而是先阅读每个小段落并写出简短摘要,然后再通过阅读这些摘要来理解整个情节。这就像新闻主播总结当天的事件,而不是去读每一份原始的警察报告。这使得机器人运行得更快,且需要的计算机内存更少,使其能够记住长达 两分钟 的历史。
测试:REMEMBENCH(机器人记忆考试)
为了证明他们的机器人确实拥有记忆,作者创建了 REMEMBENCH。你可以把它看作是机器人记忆的“标准化驾照考试”。它不仅测试机器人是否能移动手臂,还测试四种特定类型的短期记忆:
- 空间记忆: “我把那个水果放在哪儿了?”(机器人必须找到一个它目前看不见的物体)。
- 预期记忆: “我需要在 2 分钟后关掉炉灶。”(机器人必须根据过去的触发点记住未来的动作)。
- 物体关联记忆: “我洗了这个苹果,所以我必须把它放回这个特定的碗里。”(机器人记得哪个物体对应哪个容器)。
- 物体集合记忆: “我需要移动所有的面包棒,但我必须在移动过程中进行计数。”(机器人会对一组物品进行累计计数)。
结果:明显的胜出者
当他们将 PRISM 与其他机器人(包括具有标准“长记忆”或不同类型 AI 大脑的机器人)进行对比测试时:
- 在记忆测试中: PRISM 是明显的赢家,比排名第二的机器人高出了显著的幅度(5% 到 12%)。
- 在标准任务中: 即使是在那些不显式测试记忆的任务中,PRISM 也表现得更好。为什么呢?因为拥有记忆有助于机器人理解上下文。例如,知道自己是“刚刚拿起”了一个杯子还是“正准备放下”一个杯子,有助于避免混乱。
- 现实世界: 当他们在真实的物理机器人上进行测试时,没有记忆的机器人完全失败了(成功率为 0%),而 PRISM 成功了 30% 的时间。
核心结论
该论文声称,通过使用“保镖”来过滤噪声,以及使用“总结器”来节省空间,机器人终于可以记住几分钟前发生的事情。这使它们能够处理需要一系列步骤的长周期、复杂家务,而不仅仅是针对即时时刻做出反应。作者提供了机器人大脑(PRISM)和测试方法(REMEMBENCH),以帮助其他研究人员构建更具记忆能力的机器人。
技术摘要:面向长程任务的视觉运动策略短期记忆扩展
1. 问题陈述
机器人任务通常需要短期记忆(跨度从数秒到数分钟),以处理部分可观测性问题,例如检索不再可见的物体,或执行如关闭电器等需要定时动作的任务。然而,目前大多数通过模仿学习训练的视觉运动策略都是近视的(myopic),仅依赖即时感官输入,而无法利用过去的经验。
将标准的基于 Transformer 的策略扩展到包含更长的上下文窗口以解决此问题,面临两个关键挑战:
- 伪相关性(Spurious Correlations): 盲目地关注长历史记录会引入无关信息(例如,过去的干扰物位置),导致模型学习到错误的关联,从而在上下文发生变化时降低性能。
- 计算可扩展性(Computational Scalability): 标准注意力机制的计算和内存占用随上下文长度呈线性或二次方级增长。处理高维视觉输入在长时序(例如数分钟)上的过程,其计算成本将变得极其昂贵。
2. 方法论:PRISM
作者提出了 PRISM(具有短期记忆的策略架构),这是一种旨在通过两项关键创新来有效利用短期记忆的 Transformer 架构:
- 门控注意力(信息过滤): 为了减轻伪相关性的影响,PRISM 引入了一种后注意力门控机制(post-attention gating mechanism)。该组件通过使用以当前输入特征为条件的学习门控来调节每个注意力块的输出,从而选择性地过滤检索到的信息。这使得策略能够自适应地抑制来自历史记录的无关细节,减少噪声对动作预测的影响。
- 分层架构(效率): 为了解决可扩展性问题,PR prism 采用了分层设计。
- 局部编码(Local Encoding): 局部记忆编码器处理感官输入,并使用类似 Perceiver 的重采样器将其压缩为紧凑的 Token。
- 全局注意力(Global Attention): 全局记忆编码器在这些压缩后的 Token 上进行跨时间的注意力计算。
- 融合(Fusion): 生成的全局信息通过残差连接广播回并与原始局部 Token 进行融合。
- 优势: 这种方法将计算复杂度从 O((n⋅ktot)2) 降低到大约 O(n⋅ktot⋅m+(n⋅ktot/m)2),其中 m 是压缩因子。它还通过仅缓存压缩后的摘要 Token,显著降低了测试时的内存占用。
PRISM 使用标准的行为克隆(模仿学习)进行训练,无需辅助损失或外部记忆模块,在闭环设置中将过去感官输入和动作的序列映射到未来的动作。
3. 核心贡献
- PRISM 架构: 一种新型策略架构,结合了门控注意力和分层汇总技术,能够在保持计算效率和对噪声鲁棒性的同时,将短期记忆扩展至两分钟(以 2–3 Hz 运行)。
- REMEMBENCH: 一个全新的基准测试,包含八个多样化的家庭操纵任务,涵盖了源自认知科学的四类短期记忆:
- 空间记忆(Spatial): 回忆物体位置(例如,检索隐藏的水果)。
- 预期记忆(Prospective): 在延迟期间保留意图(例如,烹饪肉类达到特定时长)。
- 物体关联记忆(Object-Associative): 回忆物体与位置的关联(例如,将洗净的物品放回其原本的碟子)。
- 物体集合记忆(Object-Set): 维护并更新多个物体的集合(例如,统计移动到微波炉中的面包棒数量)。
- 与以往专注于单一方面或间接记忆测试的基准不同,REMEMBENCH 明确要求必须具备记忆才能成功,因为即时的感官输入不足以完成任务。
4. 实验结果
论文在 REMEMBENCH 和标准基准测试上将 PRISM 与循环架构(LSTM、Mamba)、段级循环 Transformer(Transformer-XL)以及其他 Transformer 变体(线性注意力、场景记忆 Transformer)进行了对比评估。
- REMEMBENCH 表现: PRISM 实现了 41% 的平均成功率,比最强的基线模型(SMT 为 36%,PTP 为 28%,Mamba 为 25%)高出 5%–12% 的绝对值。
- 缩放性: 性能随记忆大小而提升;将窗口从 1 步增加到 512 步,成功率从 16% 提升至 42%,且未出现饱和现象。
- 消融实验: 移除门控机制会导致性能下降 16 个百分点,证实了其在过滤无关历史方面的必要性。
- 标准基准测试(ROBOCASA & LIBERO):
- 在 ROBOCASA 上,带有记忆(n=256)的 PRISM 实现了 43% 的成功率,比其无记忆版本高出 11%,比经过微调的 GR00T-N1-2B 基线高出 11%。
- 在 LIBERO 上,PRISM 实现了 89% 的平均成功率,比经过微调的 OpenVLA 基线高出 15%,比其无记忆版本高出 12%。
- 作者指出,添加记忆有助于解决视觉上高度相似状态下的动作歧义(例如,区分“刚刚抓取”与“即将放置”),即使在并非专门设计用于测试记忆的任务中,也能减少多模态问题。
- 真实世界评估: 在“清洗并返回容器”任务的真实世界适配中,PRISM 实现了 30% 的成功率,而没有记忆的 Transformer 基线为 15%,完全没有记忆的策略为 0%。
- 效率: 在上下文长度为 512 步时,与全全局注意力(full global attention)和混合滑动窗口方法相比,PRISM 将峰值 GPU 显存占用降低了 80%,运行时间缩短了 40%。
5. 重要性与主张
本文主张 PRISM 和 REMEMBENCH 为开发和评估能够处理长程任务的短期记忆增强型视觉运动策略奠定了基础。
- 泛化性: 通过覆盖四种不同的记忆类别,REMEMBENCH 鼓励开发通用的记忆机制,而非孤立的、针对特定任务的解决方案。
- 可扩展性: PRISM 证明了可以在不产生与朴素扩展上下文窗口相关的过高成本的情况下,将短期记忆扩展到数分钟的交互。
- 鲁棒性: 门控注意力机制被证明对于防止模型在嘈杂的长程数据中学习伪相关性至关重要。
作者总结道,虽然 REMEMBENCH 上目前的成功率(约 30%–40%)表明长程任务仍然具有挑战性,但记忆增强在不同架构和基准测试中取得的一致收益验证了该方法的有效性。他们指出了未来的研究方向,例如集成持久的长期记忆以及利用互联网规模的预训练来增强记忆模块,但强调目前的工作严格聚焦于模仿学习框架内短期记忆的机制。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。