这篇论文介绍了一个名为 HAMLET 的新方法,旨在解决机器人“健忘”的问题,让它们能像人类一样拥有“历史记忆”,从而更聪明地完成复杂的任务。
我们可以把这篇论文的核心思想想象成:给一个只有“瞬间视力”的超级机器人,装上了一副“记忆眼镜”和一个“智能记事本”。
以下是通俗易懂的解读:
1. 机器人的痛点:只有“现在”,没有“过去”
目前的先进机器人(被称为 VLA 模型,即视觉 - 语言 - 动作模型)非常聪明,它们能看懂图片、听懂指令。但是,它们有一个致命的弱点:它们只看得到“现在这一秒”发生了什么,完全记不住上一秒或上上秒的事。
- 比喻: 想象一个只有 3 秒钟记忆的“金鱼”超级英雄。
- 场景: 你让机器人把杯子盖在方块上,然后再把另一个杯子叠上去。
- 问题: 当机器人拿起第二个杯子时,它只看得到眼前:桌上有个方块,上面盖着个杯子。它完全忘了刚才自己亲手把第一个杯子盖上去的。
- 后果: 它可能会困惑:“咦?这个杯子哪来的?我是不是该把它拿开?”或者它可能会去抓那个已经被盖住的方块,导致任务失败。
2. 现有的笨办法:把过去“硬塞”进眼睛
为了解决这个问题,以前的尝试通常是把过去几秒的视频画面直接塞给机器人看(就像把过去 4 张照片贴在现在的照片旁边)。
- 比喻: 这就像让金鱼同时盯着 4 张照片看。
- 缺点:
- 太慢太卡: 处理这么多图片,机器人的大脑(显卡)会过载,反应变慢,就像电脑开了太多窗口会卡死一样。
- 信息过载: 照片里有很多没用的东西(比如静止的墙壁、背景),机器人会被这些噪音干扰,反而看不清重点。
3. HAMLET 的解决方案:聪明的“记忆压缩”
HAMLET 不直接把过去的照片塞给机器人,而是教机器人学会**“写日记”和“查笔记”**。它包含两个核心部分:
A. “时刻令牌” (Moment Tokens) —— 智能摘要员
- 作用: 在每一秒,机器人都会生成一个小小的“摘要令牌”。这个令牌不是简单的图片,而是经过特殊训练的“精华”。
- 比喻: 想象机器人有一个速记员。每过一秒,速记员不看整张复杂的照片,而是迅速写下:“刚才我把蓝色的方块拿起来了”或者“刚才那个杯子被盖住了”。
- 训练技巧: 这个速记员经过了一种特殊的训练(时间对比学习),让他学会只记变化的、重要的事(比如手在动、物体在变),而自动忽略那些没变的背景(比如桌子、墙壁)。
B. “记忆模块” (Memory Module) —— 智能档案柜
- 作用: 当机器人需要做决定时,它不会去翻过去的 4 张照片,而是去查这个“档案柜”。档案柜里存着刚才速记员写下的那些“摘要”。
- 比喻: 这是一个聪明的图书管理员。
- 如果机器人问:“我现在该抓哪个杯子?”
- 管理员会迅速翻阅档案,发现:“啊,3 秒前你盖住了蓝色方块,所以你现在应该去拿那个还没被盖住的杯子。”
- 管理员会自动过滤掉那些不重要的旧信息,只把最关键的线索告诉机器人。
4. 为什么 HAMLET 这么厉害?
- 不伤脑筋(高效): 它不需要机器人去处理一堆过去的照片,只需要处理几个小小的“摘要令牌”。这就像查字典比翻完一整本书快得多。
- 越老越香(长任务): 在需要多步推理的长任务中(比如先拿 A,再拿 B,最后把 A 放回原处),HAMLET 表现惊人。
- 数据说话: 在真实的机器人实验中,HAMLET 让原本成功率只有 29% 的机器人,直接提升到了 76.4%!这相当于让一个经常迷路的人突然变成了导航专家。
- 通用性强: 它像一个“插件”,可以插在任何现有的先进机器人模型上,不需要把机器人重新从头训练一遍。
5. 总结
HAMLET 就像是给机器人装上了**“海马体”**(人类大脑中负责记忆的区域)。
- 以前的机器人: 像是一个只有瞬间记忆的魔术师,做完一个动作就忘了刚才干了什么,容易在复杂的戏法中穿帮。
- 现在的 HAMLET 机器人: 像是一个经验丰富的老手,它记得刚才的每一个步骤,知道“因为刚才我盖了杯子,所以现在我要拿另一个杯子”。
这项技术让机器人不再只是对“当下”做出反应,而是能够基于“过去”的经验来规划“未来”,这对于让机器人真正走进家庭、完成复杂的家务(如做饭、整理房间)至关重要。
这是一篇发表于 ICLR 2026 的会议论文,题为 HAMLET: SWITCH YOUR VISION-LANGUAGE-ACTION MODEL INTO A HISTORY-AWARE POLICY。
以下是对该论文的详细技术总结:
1. 研究背景与问题 (Problem)
- 现状:现有的视觉 - 语言 - 动作模型(Vision-Language-Action Models, VLAs,如 RT-2, OpenVLA, GR00T 等)在机器人策略学习中表现出色。然而,大多数 VLA 采用单帧假设(Single-frame assumption),即仅根据当前时刻的观测(Observation)来预测动作,忽略了历史上下文。
- 核心痛点:机器人操作任务本质上是**依赖历史(History-dependent)**的。例如,在“将物体放在桌上”的任务中,决策取决于物体是否已被抓取;在物体被遮挡或需要多步推理的长程任务中,仅凭当前帧无法确定正确的下一步动作。
- 现有挑战:直接引入历史上下文(如简单地将多帧图像拼接输入)会导致巨大的计算开销(推理延迟增加约 35%,显存占用增加约 3.6 倍),且限制了批量大小,难以扩展。此外,简单的多帧输入可能导致模型学习到虚假的时间相关性(Causal Confusion),反而降低性能。
- 研究问题:如何在不从头进行昂贵预训练的前提下,将历史感知能力高效地集成到预训练的 VLA 中?
2. 方法论 (Methodology)
作者提出了 HAMLET(History-Aware Memory with LEarned Tokens),这是一个即插即用的微调框架,旨在让预训练的 VLA 具备历史感知能力。该框架包含两个核心组件:
A. 时刻令牌 (Moment Tokens)
- 设计:在每个时间步 t,向 VLM 的输入序列中附加一组可学习的令牌(Moment Tokens, mt)。
- 功能:这些令牌将当前时刻的视觉观测 ot 和任务指令压缩为一个紧凑的、上下文感知的表示 mt′。
- 初始化策略(时间对比学习 TCL):
- 为了防止令牌仅学习静态背景,作者采用**时间对比学习(Time-Contrastive Learning, TCL)**进行初始化。
- 正样本:同一时刻经过不同增强(光度变换、模糊、噪声、遮挡)的图像对应的令牌。
- 负样本:同一轨迹中不同时刻(t′=t)的令牌。
- 目标:迫使令牌捕捉时间上具有区分度的特征(如动态变化的物体、机械臂),同时抑制静态背景信息。在此阶段冻结 VLM 主干。
B. 记忆模块 (Memory Module)
- 设计:一个轻量级的 Transformer 模块,用于聚合跨时间步的时刻令牌。
- 机制:
- 将最近 T 个时间步的时刻令牌堆叠成历史矩阵 M′。
- 利用**因果自注意力(Causal Self-Attention)**机制,让当前时刻的令牌能够选择性关注过去最有信息量的时刻,而忽略冗余信息。
- 输出历史增强的令牌表示 m~t′。
- 动作预测:将历史增强的表示 m~t′ 与原始 VLM 的隐藏状态 ht 拼接,作为动作专家(Action Expert,如 Diffusion Head)的条件输入,从而预测未来的动作序列。
3. 主要贡献 (Key Contributions)
- 提出 HAMLET 框架:一种易于集成的微调方案,使预训练的 VLA 无需从头训练即可具备历史感知能力。
- 创新组件设计:
- 引入时刻令牌,通过时间对比学习初始化,有效提取任务相关的时序特征。
- 设计轻量级记忆模块,能够选择性聚合历史令牌,解决简单拼接带来的冗余和因果混淆问题。
- 广泛的实验验证:在真实世界和仿真环境中进行了全面评估,证明了该方法在长程任务和通用基准上的有效性。
- 高效性:相比 naive 的多帧输入方法,HAMLET 在显著提升性能的同时,仅增加了极小的推理延迟和显存开销。
4. 实验结果 (Results)
作者在真实世界机器人和多个仿真基准(RoboCasa, LIBERO, SimplerEnv-Bridge)上进行了测试,主要基线包括 GR00T N1.5, π0, CogACT 等。
真实世界长程任务:
- 在基于 GR00T N1.5 的实验中,HAMLET 在依赖历史的真实世界任务(如“放置两次”、“覆盖并堆叠”、“交换方块”)上,平均成功率从基线的 29.2% 提升至 76.4%(提升 47.2%)。
- 特别是在处理物体遮挡和多步推理任务时,HAMLET 表现出显著优势,而 naive 多帧基线表现不佳。
仿真基准测试:
- RoboCasa Kitchen:在 100 次演示设置下,HAMLET 将 GR00T N1.5 的成功率从 64.1% 提升至 66.4%。
- LIBERO:将 prior art 性能从 95.6% 提升至 97.6%(接近饱和状态下的进一步提升)。
- SimplerEnv-Bridge (CogACT):将 CogACT 的平均完整任务成功率从 52.1% 提升至 63.5%。
效率分析:
- 在历史长度为 8 时,naive 多帧方法的推理延迟是单帧的 2.4 倍,显存占用是 7 倍。
- HAMLET 在相同设置下,推理延迟仅增加 1.07 倍,显存增加 2.0 倍,证明了其极高的效率。
消融实验与泛化性:
- 移除记忆模块或 TCL 初始化均会导致性能下降,证明了各组件的必要性。
- 在 LIBERO 上训练的记忆模块可以直接迁移到 RoboCasa 任务中,显示出良好的跨数据集泛化能力。
- 该方法同样适用于扩散策略(Diffusion Policy)和自回归策略(Autoregressive Policy,如 OpenVLA, π0-FAST)。
5. 意义与结论 (Significance & Conclusion)
- 解决关键瓶颈:HAMLET 成功解决了 VLA 在长程机器人操作中缺乏历史记忆的问题,同时避免了从头训练或引入巨大计算开销的代价。
- 通用性与可扩展性:该框架是“骨干无关(Backbone-agnostic)”的,可以无缝集成到各种预训练的 VLA 中,且不需要额外的预训练数据。
- 实际价值:通过轻量级的记忆机制和高效的令牌压缩,HAMLET 使得现有的开源 VLA 能够更可靠地处理复杂的、非马尔可夫(Non-Markovian)的机器人操作任务,为未来部署更智能的具身智能体提供了重要的技术路径。
总结:HAMLET 通过引入“时刻令牌”和“轻量级记忆模块”,以极低的计算成本赋予了预训练 VLA 强大的历史感知能力,显著提升了机器人在长程、遮挡及多步推理任务中的表现,是具身智能领域的一项重要进展。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。