← 最新论文
🤖 AI

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

SkillMemo 是一个专家引导的框架,它通过混合专家架构将长程轨迹隐式分解为潜在的原子技能,并将其集成到动态情境记忆库中以提供稳健的上下文先验,从而增强具身视觉运动模型的组合泛化能力。

原作者: Changyuan Wang, Chubin Zhang, Zhenyu Wu, Runhao Li, Angyuan Ma, Ke Chao, Yinan Liang, Xiuwei Xu, Ziwei Wang, Yansong Tang, Jiwen Lu

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Changyuan Wang, Chubin Zhang, Zhenyu Wu, Runhao Li, Angyuan Ma, Ke Chao, Yinan Liang, Xiuwei Xu, Ziwei Wang, Yansong Tang, Jiwen Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人做一道复杂的菜。你不仅仅是告诉它“做晚饭”;你还向它展示了一个包含整个过程的视频:切菜、煎炸、装盘和上菜。在机器人领域,这被称为“具身操控”(embodied manipulation),即机器根据它所看到的画面来学习如何在现实世界中移动身体。长期以来,科学家们一直尝试通过向机器人输入海量的这些演示视频来对其进行训练。最流行的方法通常被称为“扩散策略”(Diffusion Policies)或“视觉-语言-动作”(Vision-Language-Action)模型,它们就像一个超级聪明的学生,通过背诵整个视频来学习。它们非常擅长精确地复制曾经见过的场景。然而,面对新情况时,它们会遇到瓶颈。如果要求一个接受过“把苹果放入碗中”训练的机器人去“把柠檬放入锅中”,它往往会陷入僵局。这就像一个背下了特定考试题库答案的学生,一旦题目顺序发生变化,就会无法应对。问题的核心在于,这些机器人试图一次性记住整部电影,而不是理解构成故事的单个场景或“技能”。

这就是名为 SkillMemo 的新想法介入的地方。SkillMemo 不再试图将整个视频作为一个巨大的、不可分割的整体进行记忆,而是教会机器人将视频分解为微小的、可重用的“原子技能”——比如“抓取”、“抬起”或“放置”。然后,它将这些技能存储在一个特殊的动态库(记忆库)中,机器人可以在工作时检索这些技能。这就像一位厨师,不仅记住了“炒菜”的食谱,而且在脑海中建立了一个关于如何切菜、如何翻炒以及如何调味的索引。当厨师需要制作新菜肴时,他们并不从零开始,而是从记忆中迅速提取出正确的“切菜”技能和“翻炒”技能,并将它们组合在一起。本文提出的观点是,通过赋予机器人这种“技能记忆”,它们可以更好地处理全新的、未见过的任务组合,从而使它们的动作变得更加灵活且更像人类。

问题所在:无法“混搭”的机器人

目前的机器人大脑虽然令人印象深刻,但有一个特定的弱点。它们通过大量的人类演示数据进行训练,学习根据当前的图像预测下一步动作。然而,这些模型通常将一个任务视为一个单一的、整体的数据块。如果机器人学会了“拿起杯子并倒水”,它学到的是这个特定的序列。如果你接着要求它“拿起杯子并倒果汁”,或者“拿起碗并倒水”,它可能会表现挣扎,因为它从未见过这种精确的组合。它缺乏将动作分解为更小、可重用部分的的能力。这就像一位音乐家,可以完美地演奏一首特定的歌曲,却无法利用相同的音符即兴创作一段新的旋律。

作者认为,解决方案不仅仅是给机器人喂入更多的数据(这既昂贵又难以获取),而是要改变机器人学习和记忆的方式。他们建议,机器人需要学会独立识别并存储“技能”,以便稍后进行混搭。

解决方案:拥有“技能库”的机器人

本文介绍了一个名为 SkillMemo 的框架,它充当了机器人技能的智能图书管理员。它主要分为两个阶段:

1. 将电影拆解为场景(专家引导的轨迹分割)
首先,系统需要确定一个技能在哪里结束,另一个技能在哪里开始。与其要求人类为每一个动作进行标注(这非常繁琐),SkillMemo 使用了一种巧妙的技巧,称为混合专家模型(Mixture-of-Experts, MoE)。想象一下机器人大脑内部有一支由专业人员组成的团队(即“专家”)。当机器人观看演示时,不同的专家轮流“值班”。一个专家可能擅长“抓取”,另一个擅长“移动”,还有一个擅长“放置”。系统学习如何自动在这些专家之间切换。当“抓取”专家处于活跃状态时,机器人就知道它正处于任务的“抓取”阶段。这一过程无需任何人工标签;机器人通过观察运动模式,能够自动识别出技能的边界。

2. 存储与检索技能(技能级记忆)
一旦机器人将任务分解为这些细小的、截然不同的技能,它就会将它们存储在一个动态情境记忆库中。这不仅仅是一个视频文件,而是一个精简的“如何做”指令库。

  • 键(Key): 系统保存了该技能被使用时情境的摘要(例如,“附近有一个碗”)。
  • 值(Value): 它保存了执行该技能的具体指令(即告诉机器人大脑激活哪些专家的“门控系数”)。

当机器人面临新任务时,它不会盲目猜测。它会观察当前情况,在记忆库中搜索最相关的技能,并将其提取出来。然后,它将检索到的技能与当前的计划相结合。如果它需要“把柠檬放入锅中”,它可能会从一个记忆中提取“抓取柠檬”的技能,从另一个记忆中提取“倒入锅中”的技能,并将它们融合在一起,创造出一个新的成功动作。

实验结果表明

研究人员通过两种方式测试了这个想法:在计算机模拟中,以及在实验室中使用真实的机器人手臂(UR5e)。

在模拟环境中:
他们在标准机器人挑战赛中测试了 SkillMemo,包括 LIBERO 基准测试(测试机器人对新任务的泛化能力)以及其他环境如 Push-TFranca Kitchen

  • 结果: 当我们将 SkillMemo 添加到现有的机器人模型(如扩散策略和大型视觉-语言-动作模型)中时,机器人的表现显著提升。
  • 数据: 在 LIBERO 基准测试中,标准模型 π0.5\pi_{0.5} 的成功率达到了 96.8%。加入 SkillMemo 后,这一数字跃升至 98.0%。虽然这听起来只是一个很小的数字,但在机器人领域,1.2% 的提升是非常巨大的进步。
  • 泛化能力: 最令人兴奋的发现是机器人处理从未见过的任务时的表现。例如,如果机器人接受过“把草莓放入碗中”和“把柠檬放在盘子里”的训练,它可以成功地完成“把草మైన草莓放在盘子里”的任务,即使它从未接受过这种特定组合的训练。记忆库让它能够以一种全新的方式重用“草莓”技能和“盘子”技能。

在现实世界中:
团队还在真实机器人手臂上测试了该系统,涵盖了五种不同的任务,例如把草莓放入碗中或把黄油放入锅中。

  • 结果: SkillMemo 一贯优于标准的扩散策略。对于“将黄油放入锅中”的任务,成功率从 62.5% 提高到了 75.0%
  • 未见组合: 当他们测试机器人处理新组合(如把柠檬放入锅中,这是训练期间未见过的)时,SkillMemo 将成功率从 57.5% 提升到了 72.2%。这证明了机器人不仅仅是在死记硬背,它确实在进行技能的重组。

本文排除了什么,证实了什么

作者谨慎地指出,他们的方法不是什么。他们反对仅仅通过扩大机器人的大脑规模或使用更多原始数据进行训练才是唯一解决方案的观点。他们表明,如果没有一种结构化的方式来记忆和重用技能,即使是强大的模型也会在面对新组合时感到吃力。

他们同时也证实,该方法不需要人类手动标记训练视频中的每一个“技能”。机器人可以自主学习识别这些边界。然而,论文明确指出,这些结果是基于特定的模拟环境和有限的现实任务。虽然结果很强,但其应用范围仍限于特定的基准测试,且“现实世界”的测试是在受控的实验室环境中进行的。

为什么这很重要

SkillMemo 的核心思想是,机器人需要变得更像我们:能够将复杂的动作分解为更小的、可重用的部分,并记住如何去做。通过赋予机器人一个可以搜索和混合的“技能库”,我们可以帮助它们应对现实世界中复杂且不可预测的特性。与其做一个在剧本改变时就会失效的僵化模仿者,这些机器人可以成为灵活的问题解决者,利用已有的知识去应对从未遇到的情况。本文表明,这种方法是朝着让机器人真正适应我们的世界,而不仅仅是重复指令,迈出的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →