← 最新论文
💻 computer science

Memory Anchors for Continual Robot Learning

本文引入了“记忆锚点”(Memory Anchors),即通过冲突任务表示识别出的过去经验的一个策略性子集,当这些经验在回放缓冲器中被优先处理时,能显著缓解灾难性遗忘,并使机器人实现有效的持续学习。

原作者: Maximilian Du, Zhanyi Sun, Chen Xu, Paarth Shah, Masha Itkina, Shuran Song

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Maximilian Du, Zhanyi Sun, Chen Xu, Paarth Shah, Masha Itkina, Shuran Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个正在学习连续执行一系列任务的机械臂。在现实世界中,这些任务很少是孤立存在的;它们往往看起来非常相似,但却需要不同、有时甚至是相反的动作。机器人可能需要通过顺时针旋转来打开一个罐子,然后在稍后学习打开另一个不同的罐子时,需要进行逆时针旋转。人工智能面临的挑战在于,当它学习新技能时,往往会覆盖掉旧的记忆,这种现象被科学家称为“灾难性遗忘”。为了防止这种情况,研究人员通常使用一种叫做“经验回放”(experience replay)的方法,让机器人练习新旧数据的混合组合,就像学生在学习新知识时复习过去的笔记一样。多年来,标准的做法是随机抽取这些旧笔记,假设过去的任何样本都是同样有帮助的。

然而,来自斯坦福大学和丰田研究院(Toyota Research Institute)研究人员的一项新研究表明,并非所有的记忆都是平等的。他们发现,在机器人庞大的经验历史中,存在着一小部分关键数据,它们充当了至一个至关重要的锚点,稳固着机器人对先前任务的知识。研究人员将这些特定的记忆称为“记忆锚点”(Memory Anchors)。他们的工作表明,如果机器人的训练数据缺失了哪怕很小比例的这些锚点,机器人遗忘旧技能的速度就会大大加快。相反,如果训练数据中有意识地丰富了这些特定的记忆,机器人就可以在学习新的、相互冲突的任务时,而不丢失旧的任务。这一发现将关注点从单纯收集更多数据,转向了如何仔细挑选过去最重要的时刻,以保护机器人不断增长的智能。

研究人员首先观察到,即使机器人使用经验回放,其表现对于它恰好选择了哪些旧数据也表现出惊人的敏感性。在实验中,他们发现某些随机选择的旧数据能让机器人完美保留技能,而另一些随机选择则会导致机器人几乎完全丧失这些技能。这种不一致性指向了一个隐藏的模式:某些任务之所以在顺序学习中更难,是因为它们与之前的任务在视觉上非常相似,但在物理动作上却截然不同。例如,机器人可能会看到一个碗和一个罐子,它们看起来很像,但一个需要提升,而另一个需要扭转。当机器人学习新任务时,它对物体外观的内部理解可能会坍缩到与旧任务相同的心理类别中,从而导致动作执行上的混乱。

为了解决这个问题,团队开发了一种识别并隔离这些关键时刻的方法。他们寻找的是在当前任务中,机器人的现有理解与之前所学知识发生最剧烈冲突的具体点。他们发现了那些机器人的眼睛看到了熟悉的东西,但大脑却知道必须做出不同动作的时刻。通过这些冲突时刻,他们回溯到机器人的过去,提取出那些与这个令人困惑的新情况看起来最相似的旧经验。这些被检索出的记忆就是“记忆锚点”。它们作为一个参考点,提醒机器人虽然物体看起来一样,但所需的动作是不同的,从而有效地防止了新学习对旧知识的抹除。

团队通过故意从机器人的训练数据中移除这些锚点来测试这一想法。结果非常显著:当他们剔除了仅 10% 的最佳锚点时,机器人对过去任务的遗忘程度增加了超过四倍半。这证明了极少数特定的记忆承担了保护机器人历史记忆的重任。在第二组测试中,他们做了相反的操作:他们拿取了一个标准的训练缓冲区,并用额外的记忆锚点将其填满。这一简单的调整使机器人对困难且冲突任务的遗忘率降低了 63%。机器人能够学习一系列原本会导致失败的任务序列,甚至在掌握第三个任务后,依然能保持执行第一个任务的能力。

为了确保这不仅仅是模拟实验,研究人员将他们的方法应用到了实验室中的一个真实机械臂上。他们设置了一系列涉及外观相同的罐子的任务,这些罐子需要不同的开启策略:一个需要逆时针扭转,一个需要顺时针扭转,第三个则需要直接提起。如果没有这种特殊方法,机器人会学会第一个任务,然后在学习第二个任务时完全忘记它,或者因为害怕出错而无法学会第二个任务。当应用记忆锚点策略时,机器人成功地按顺序学习了所有三个任务。它的成功率比使用标准随机混合旧数据的机器人高出 1.7 倍。机器人学会了区分这些罐子的细微差别并执行正确的动作,证明了锚点帮助它在学习新事物与记住旧事物之间取得了平衡。

该研究还探讨了这种方法在不同类型“机器人大脑”上的表现,包括已经非常聪明的预训练大型模型。即使对于这些通常具备更好记忆能力的先进系统,记忆锚点的存在也带来了显著差异。研究人员发现,当训练数据有限时,这些模型同样会在缺少关键锚点的情况下出现遗忘现象,并且在加入锚点后得到了改善。这表明,无论软件的复杂程度如何,这一原则对于机器如何从经验中学习是基础性的。关键不在于拥有多少数据,而在于在正确的时间拥有正确的数据,以作为对抗新学习带来的混乱的稳定器。

这项研究为我们如何思考机器如何在不丢失过去的情况下变得更聪明提供了一种新途径。它表明,要实现一个能在野外进行持续学习的机器人,路径不仅仅是喂给它更多的信息,而是要教会它去识别并重视那些过去与现在发生碰撞的特定时刻。通过识别这些记忆锚点,工程师可以构建出更鲁棒的系统,能够处理物理世界中混乱且重叠的现实。这项工作推动了该领域的发展,证明在持续学习的过程中,记忆的质量远比数量重要,而几个精心挑选的过去时刻,就能保障机器人智能的未来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →