← 最新论文
💻 computer science

HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy

HAMLET 提出了一种可扩展框架,通过引入基于时间对比学习的时刻令牌(moment tokens)和轻量级记忆模块,将现有的视觉 - 语言 - 动作模型(VLA)转化为能够利用历史上下文进行动作预测的历史感知策略,从而在长程及依赖历史信息的机器人操作任务中显著提升了成功率。

原作者: Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 HAMLET 的新方法,旨在解决机器人“健忘”的问题,让它们能像人类一样拥有“历史记忆”,从而更聪明地完成复杂的任务。

我们可以把这篇论文的核心思想想象成:给一个只有“瞬间视力”的超级机器人,装上了一副“记忆眼镜”和一个“智能记事本”。

以下是通俗易懂的解读:

1. 机器人的痛点:只有“现在”,没有“过去”

目前的先进机器人(被称为 VLA 模型,即视觉 - 语言 - 动作模型)非常聪明,它们能看懂图片、听懂指令。但是,它们有一个致命的弱点:它们只看得到“现在这一秒”发生了什么,完全记不住上一秒或上上秒的事。

  • 比喻: 想象一个只有 3 秒钟记忆的“金鱼”超级英雄。
    • 场景: 你让机器人把杯子盖在方块上,然后再把另一个杯子叠上去。
    • 问题: 当机器人拿起第二个杯子时,它只看得到眼前:桌上有个方块,上面盖着个杯子。它完全忘了刚才自己亲手把第一个杯子盖上去的。
    • 后果: 它可能会困惑:“咦?这个杯子哪来的?我是不是该把它拿开?”或者它可能会去抓那个已经被盖住的方块,导致任务失败。

2. 现有的笨办法:把过去“硬塞”进眼睛

为了解决这个问题,以前的尝试通常是把过去几秒的视频画面直接塞给机器人看(就像把过去 4 张照片贴在现在的照片旁边)。

  • 比喻: 这就像让金鱼同时盯着 4 张照片看。
  • 缺点:
    1. 太慢太卡: 处理这么多图片,机器人的大脑(显卡)会过载,反应变慢,就像电脑开了太多窗口会卡死一样。
    2. 信息过载: 照片里有很多没用的东西(比如静止的墙壁、背景),机器人会被这些噪音干扰,反而看不清重点。

3. HAMLET 的解决方案:聪明的“记忆压缩”

HAMLET 不直接把过去的照片塞给机器人,而是教机器人学会**“写日记”“查笔记”**。它包含两个核心部分:

A. “时刻令牌” (Moment Tokens) —— 智能摘要员

  • 作用: 在每一秒,机器人都会生成一个小小的“摘要令牌”。这个令牌不是简单的图片,而是经过特殊训练的“精华”。
  • 比喻: 想象机器人有一个速记员。每过一秒,速记员不看整张复杂的照片,而是迅速写下:“刚才我把蓝色的方块拿起来了”或者“刚才那个杯子被盖住了”。
  • 训练技巧: 这个速记员经过了一种特殊的训练(时间对比学习),让他学会只记变化的、重要的事(比如手在动、物体在变),而自动忽略那些没变的背景(比如桌子、墙壁)。

B. “记忆模块” (Memory Module) —— 智能档案柜

  • 作用: 当机器人需要做决定时,它不会去翻过去的 4 张照片,而是去查这个“档案柜”。档案柜里存着刚才速记员写下的那些“摘要”。
  • 比喻: 这是一个聪明的图书管理员
    • 如果机器人问:“我现在该抓哪个杯子?”
    • 管理员会迅速翻阅档案,发现:“啊,3 秒前你盖住了蓝色方块,所以你现在应该去拿那个还没被盖住的杯子。”
    • 管理员会自动过滤掉那些不重要的旧信息,只把最关键的线索告诉机器人。

4. 为什么 HAMLET 这么厉害?

  • 不伤脑筋(高效): 它不需要机器人去处理一堆过去的照片,只需要处理几个小小的“摘要令牌”。这就像查字典比翻完一整本书快得多。
  • 越老越香(长任务): 在需要多步推理的长任务中(比如先拿 A,再拿 B,最后把 A 放回原处),HAMLET 表现惊人。
    • 数据说话: 在真实的机器人实验中,HAMLET 让原本成功率只有 29% 的机器人,直接提升到了 76.4%!这相当于让一个经常迷路的人突然变成了导航专家。
  • 通用性强: 它像一个“插件”,可以插在任何现有的先进机器人模型上,不需要把机器人重新从头训练一遍。

5. 总结

HAMLET 就像是给机器人装上了**“海马体”**(人类大脑中负责记忆的区域)。

  • 以前的机器人: 像是一个只有瞬间记忆的魔术师,做完一个动作就忘了刚才干了什么,容易在复杂的戏法中穿帮。
  • 现在的 HAMLET 机器人: 像是一个经验丰富的老手,它记得刚才的每一个步骤,知道“因为刚才我盖了杯子,所以现在我要拿另一个杯子”。

这项技术让机器人不再只是对“当下”做出反应,而是能够基于“过去”的经验来规划“未来”,这对于让机器人真正走进家庭、完成复杂的家务(如做饭、整理房间)至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →