← 最新论文
💻 computer science

Learning New Tasks via Reusable Skills: Skill-Compositional Experts for Embodied Continual Learning

本文提出了 SCE,一种技能组合专家(Skill-Compositional Experts)框架,该框架通过组合式技能落地(Compositional Skill Grounding)将任务分解为可重用的技能,并通过双重执行与转换专家(Dual Execution-and-Transition Experts)协调其执行与转换,从而缓解具身持续学习中的灾难性遗忘问题。

原作者: Shuaike Zhang, Shaokun Wang, Haoyu Tang, Jianlong Wu, Liqiang Nie

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuaike Zhang, Shaokun Wang, Haoyu Tang, Jianlong Wu, Liqiang Nie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人做家务。首先,你教它如何打开抽屉。接着,你教它如何拿起一个碗。最后,你教它把那个碗放进抽屉里。

在机器人领域,这被称为具身持续学习(Embodied Continual Learning)。机器人必须在学习新任务的同时,学会不忘记旧的任务。

问题所在:“漂移”的机器人

论文解释说,大多数机器人都有严重的记忆问题。当你教它一个新技巧时,它的内部“大脑”(具体来说,是它处理视觉和语言数据的方式)会开始发生偏移或“漂移”,以适应新任务。

这就像一位音乐家在学习一首新歌。如果他练习这首新歌练习得太多,他可能会开始把旧歌也弹错,把新歌的节奏混入其中。对于机器人来说,这非常危险,因为它不仅仅是在演奏一首歌,它还在移动物理手臂。如果机器人的内部映射发生了漂移,那么在完成任务的过程中,一个小小的错误会随着步骤的进行而不断放大,最终导致任务彻底失败。这被称为灾难性遗忘(catastrophic forgetting)

解决方案:“乐高积木”法 (SCE)

作者提出了一个名为 SCE(技能组合专家,Skill-Compositional Experts)的新框架。他们并没有教机器人将每一个新任务都视为一个全新的、庞大的指令,而是教它将一切拆解成小的、可重复使用的乐高积木(技能)。

以下是 SCE 如何运作,它主要使用了两个工具:

1. “技能组织者” (CSG)

想象你有一个指令盒。**组合技能接地(Compositional Skill Grounding, CSG)**模块就像是一个聪明的图书管理员。它观察一段机器人执行复杂任务(例如“把碗放入抽屉”)的长视频,并将其切分成微小的、可重复使用的块:

  • 块 A: “抓取碗。”
  • 块 B: “举起碗。”
  • 块 C: “打开抽屉。”
  • 块 D: “放置碗。”

它将这些块保存在一个技能库(Skill Base)(即数字图书馆)中。现在,当机器人需要学习一个任务时,它不需要从零开始。它只需从库中取出现有的“抓取”和“放置”积木,然后按新的顺序将它们拼凑在一起。

2. “双专家大脑” (DETE)

一旦机器人拥有了它的乐高积木库,它就需要一个大脑来决定如何使用它们。这就是**双执行与转换专家(Dual Execution-and-Transition Experts, DETE)**模块。它有两个专门的助手协同工作:

  • “执行者”(执行专家/The "Doer"): 这个助手擅长完美地执行特定的技能。如果机器人需要“抓取碗”,这个专家就会接管,确保机器人精准无误地抓取,就像它第一次做的那样。这防止了机器人“忘记”如何抓取。
  • “切换者”(转换专家/The "Switcher"): 这个助手是转换大师。它知道如何从“抓取”平滑地过渡到“举起”。它处理的是一个技能结束与另一个技能开始之间那段混乱的中间部分。

这两个专家协同工作。“执行者”保持单个技能的稳定性,而“切换者”则确保机器人在切换动作时不会踉跄。

为什么这很重要

论文在计算机模拟(使用 LIBERO 基准测试)和真实的物理机械臂上对该方法进行了测试。

  • 在模拟中: 与其他方法相比,这种新方法(SCE)在学习新任务的同时,对旧任务的记忆能力更强。它的遗忘程度要低得多。
  • 在现实世界中: 当研究人员将其应用于真实的机械臂时,效果甚至更好。机器人能够成功完成随时间推移所学到的序列任务,而其他方法在学习新任务后会导致旧任务失败。

大局观

论文声称,通过将机器人任务视为可重复使用技能的组合(就像用乐高搭建一样),而不是一个巨大的、不可更改的记忆块,机器人可以实现持续学习而不至于“丧失理智”。“执行者”保持技能敏锐,“切换者”保持流程流畅,从而防止机器人的内部映射偏离航线。

简而言之: SCE 教会机器人成为像大师级厨师那样——他们拥有一套完美的各种基本技法(切菜、煎炸、煮沸)。他们不需要每次都从头背诵整份食谱,而是通过混合搭配这些完美的技法来创造新菜肴,从而确保他们永远不会忘记如何切洋葱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →