← 最新论文
💻 computer science

NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation

NativeMEM 是一种新颖的视觉-语言-动作(VLA)策略,它集成了一种高效的原生记忆压缩方案,旨在实现实时、长时程的机器人操控,并在不依赖外部记忆模块或产生显著延迟开销的情况下,显著提高成功率和数据效率。

原作者: Ziye Wang, Modi Shi, Chaojun Ni, Jiazhi Yang, Mengdi Li, Zhizhong Su, Tianwei Lin, Hongyang Li

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziye Wang, Modi Shi, Chaojun Ni, Jiazhi Yang, Mengdi Li, Zhizhong Su, Tianwei Lin, Hongyang Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人完成一项复杂的家务,比如摆放餐具或整理杂货店。你给机器人一个摄像头和一套指令。问题在于,现在的多数机器人就像注意力非常短暂的人:它们只关注“此时此刻”正在发生的事情。如果你要求它“把红色的杯子放回原处”,它们可能会看到杯子,但如果它们不记得“原处”在哪里——因为它们只看到了当前的画面——它们就会失败。

为了解决这个问题,以前的方法尝试给机器人一本笔记本。但这些笔记本要么读起来太慢、太重,要么需要第二个“大脑”(外部模块)来记录,这会让机器人的主脑感到困惑。

NativeMEM 是一种全新的方法,它能在不增加任何额外重量或困惑的情况下,赋予机器人长期记忆。以下是它的工作原理,我们使用简单的类比来解释:

1. 问题所在:“失忆症”机器人

目前的机器人大脑(称为 VLA 模型)在观察图片并说“好吧,我看到一个杯子,我应该拿起它”方面表现出色。但如果任务需要记住 10 秒钟前发生了什么(例如,“我已经按下了蓝色按钮,所以现在我必须按下粉色按钮”),机器人就会迷失方向。它会忘记自己刚刚做了什么的故事。

2. 旧方案:“笨重的笔记本”

  • 文本笔记法: 一些研究人员尝试让第二个 AI 记录下发生的事件(“我按下了蓝色键”),并将这些文字笔记输入给机器人。这就像要求机器人在走路的同时还要读日记。这很慢,而且机器人可能会错过那些难以用文字描述的微小细节。
  • 外接硬盘法: 另一些人尝试在机器人内部添加一个独立的存储芯片。这就像是在主脑旁边添加了第二个大脑,主脑必须不断地与它进行交流。这会让机器人变得更慢、更复杂,而且主脑并不总是能理解这个新芯片的语言。

3. NativeMEM 的解决方案:“一词总结”

NativeMEM 采取了不同的方法。它不是添加一个新的笔记本或第二个大脑,而是教会机器人现有的大脑如何总结自己的过去。

  • 压缩技巧: 想象你在看一部 1 小时的电影。通常,为了记住它,你需要保存整个电影文件(体积巨大)。NativeMEM 就像是一个超级高效的剪辑师,它观看电影并为每个场景写下一个单词,这个单词能完美捕捉到该场景最重要的部分。
  • 原生语言: 因为这个“一词总结”是由机器人自己的眼睛(其视觉编码器)生成的,所以机器人能完美理解它。它不需要将内容翻译成一种“外语”(如文本笔记),也不需要与新的芯片进行沟通。这个总结就像是机器人正在阅读的句子中的另一个单词。

4. 他们是如何教学的:“两步训练法”

研究人员并不是简单地开启了这个功能,而是通过两个阶段对其进行了训练:

  • 第一阶段:学习总结。 他们冻结了机器人的主脑(这样它就不会忘记已有的知识),并训练了一个小助手来观察过去的视频,并将其转化为那些“一词总结”。他们通过这种方式教导这个助手:“如果你这样总结过去,机器人就能做出正确的动作。”
  • 第二阶段:投入实战。 一旦机器人学会了如何阅读这些总结,他们就解锁了主脑,并让它利用这些总结来练习特定任务。这就像是给机器人一份完美契合其现有思维过程的“复习资料”。

5. 结果:超强记忆,毫无减速

论文表明,这种方法是一个游戏规则的改变者:

  • 成功率: 在模拟实验中,使用 NativeMEM 的机器人成功率从仅 32% 提升到了 84%。在真实机器人上,它们的成功率达到了 98.7%。
  • 速度: 尽管机器人正在记忆数分钟的历史(数百帧画面),但它并没有变慢。它回顾 160 帧历史所需的时间,竟然和它平时看仅仅 1 帧所需的时间差不多。
  • 数据效率: 机器人使用其他方法所需的仅 20% 的训练数据就学会了这些技能。这就像是只需要练习几个小时而不是一个学期就能学会开车。

总结

NativeMEM 就像是赋予了机器人一种“超能力”,让它能在不变得迟钝或混乱的情况下,记住其完整的历史。它不需要背着沉重的视频文件背包,也不需要阅读缓慢的文本日记,而是将它完整的过去压缩成微小、高效的“记忆标记(tokens)”,这些标记可以被瞬间读取,从而让它能够解决以前无法处理的复杂长期谜题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →