← 最新论文
🤖 AI

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation

MemoryVAM 引入了一种带有回顾线索(Recap-Cue)模块的情节记忆机制,该模块将压缩的历史上下文注入视频世界模型策略中,使机器人能够克服非马尔可夫挑战,并显著提高在模拟和真实世界任务中的长程操作成功率。

原作者: Yuxin Jiang, Chang Yu, Yunuo Chen, Xiang Feng, Yin Yang, Nishank Gite, Chenfanfu Jiang

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxin Jiang, Chang Yu, Yunuo Chen, Xiang Feng, Yin Yang, Nishank Gite, Chenfanfu Jiang

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人完成一项复杂的任务,比如“拿起红色的方块三次,然后放下它”。

如果你给机器人一个只能显示过去几秒钟视频的摄像头,它就会感到困惑。当它第二次看到桌上的红色方块时,它看起来和第一次完全一样。如果没有对之前发生过什么的记忆,机器人就不知道自己已经做了一次还是两次。它可能会尝试第四次拿起它,或者过早停止。在机器人领域,这被称为“非马尔可夫”(non-Markovian)问题:当前的画面不足以决定下一步动作;你需要过去的故事。

MemoryVAM 这篇论文介绍了一个解决方案:给机器人一个“精神剪贴簿”(情景记忆),让它在工作时可以翻阅。

以下是它的工作原理,通过简单的概念进行拆解:

1. 问题所在:机器人的短期失忆症

目前的机器人大脑(称为“视频世界模型”)非常擅长根据它们现在看到的内容来预测接下来会发生什么。它们就像一位电影导演,可以根据当前的画面猜出下一场戏。

  • 缺陷: 它们只观察一个很短的时间窗口(比如过去的 5 秒钟)。如果一项任务需要 50 秒并且涉及重复相同的动作,机器人就会忘记电影的开头。它看到了一个熟悉的场景并重复了动作,即使任务已经完成了。

2. 解决方案:“回顾线索”(Recap-Cue)系统

作者构建了一个名为 MemoryVAM 的系统,它就像一个坐在机器人大脑旁边的得力助手。这个助手有两个主要职责:

  • 回顾压缩器(总结者):
    想象你在看一部长电影。你不是记住每一帧画面,而是随着剧情的发展写下关键情节的简短摘要。机器人也是这样做的。它将整个过程的所有视频历史压缩成几个“记忆标记”(极其高效的小型笔记)。

    • 类比: 这就像把一部 2 小时的电影变成一段 3 句话的情节摘要,机器人可以瞬间阅读。
  • 线索门控(终点检查员):
    这是一个小型模块,它不断地询问:“我们完成了吗?”它观察摘要笔记和当前指令,以决定任务是否已完成。

    • 类比: 这就像一名赛跑裁判,通过检查运动员的号码牌来查看他们是否完成了规定的圈数,而不仅仅是看他们现在站在哪里。

3. 它们如何连接:“双重注入”

巧妙之处在于,记忆不仅仅被输入到控制机器人手臂的部分。它是同时注入到两个地方的:

  1. “想象”引擎(视频骨干网络): 机器人利用其记忆来预测未来。如果机器人记得它已经拿起过两次方块,它的“想象”会将展示拿起第三次方块的画面,而不是第一次。这确保了机器人的预测与“我们在故事中所处的位置”这一现实相匹配。
  2. “动作”引擎(动作解码器): 机器人使用同样的记忆笔记来决定现在该做什么。

隐喻: 想想一位正在烹饪三道菜式正餐的厨师。

  • 没有记忆: 厨师看着炉灶,看到一锅水在沸腾,于是加了盐。他们不知道这是汤(第一道菜)还是酱汁(第三道菜)。他们可能会把盐加进甜点里。
  • 有了 MemoryVAM: 厨师有一张食谱卡(记忆),上面写着:“我们正在进行第三道菜。”厨师利用这张卡片来预测酱汁接下来应该是什么样子(想象),并以此决定应该加糖而不是盐(动作)。

4. 结果:从困惑到胜任

研究人员在名为 LIBERO-Mem 的基准测试上测试了该系统,这个测试充满了需要记住历史的任务(如计数、寻找隐藏物体或重复动作)。

  • 使用 MemoryVAM 之前: 机器人基本上是在瞎猜。它们的平均成功率仅为 5%
  • 使用 MemoryVAM 之后: 机器人的成功率达到了 42.5%
  • 在真实机器人上: 当他们在实际物理机器人(而非仅仅在模拟器中)上进行测试时,特定任务的成功率甚至更高:
    • 计数任务: 成功率 78.3%。
    • 寻找隐藏物体: 成功率 80.0%。
    • 追踪序列: 成功率 75.0%。

5. 为什么这很重要

论文声称,通过将记忆作为机器人“世界模型”(它理解世界的方式)的核心部分,而不仅仅是一个附加组件,机器人学得更好。它不需要人类将任务的每一步都标记为“步骤 1”、“步骤 2”等等。机器人通过尝试准确预测未来来学习追踪自己的进度。如果机器人能正确预测未来,就证明它理解了历史。

简而言之: MemoryVAM 给机器人提供了一个关于自身行为的“故事书”,让它们能够清楚地知道自己在漫长任务中的位置,防止它们陷入循环或忘记已经做过的事情。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →