Learning Action Priors for Cross-embodiment Robot Manipulation
本文提出了一种两阶段训练框架,该框架通过在无条件的运动轨迹上预训练一个轻量级动作模块以学习跨具身时间先验,随后通过解码器重用和潜变量蒸馏将该先验迁移至视觉-语言-动作模型,从而在数据稀缺的真实世界操控任务中实现更快的收敛速度、更高的成功率以及更强的泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于论文《学习跨具身机器人操控的动作先验》(Learning Action Priors for Cross-embodiment Robot Manipulation)的通俗化解释,采用了日常生活的类比。
核心问题:处于“盲目”状态的机器人
想象一下,你正在雇佣一名学徒来学习烹饪。在目前的机器人训练方法(称为视觉-语言-动作或 VLA 模型)中,你递给学徒一本内容极其丰富的食谱,里面充满了食材的照片和文字说明(即视觉和语言部分)。
然而,这本食谱完全没有提到应该如何实际移动双手。学徒从未拿过刀,从未感受过平底锅的重量,也不知道该如何切菜、搅拌或翻炒。他们必须在试图阅读食谱的同时,还要同时搞明白物理运动规律。
结果就是,学徒感到很困惑。他们可能会对着空气挥刀,或者把锅掉在地上,甚至因为试图同时学习两件极难的事情——“食谱说了什么?”以及“我的肌肉该如何运动?”——而陷入僵直状态。
这篇论文指出,目前的机器人正面临着这个完全相同的问题。它们非常擅长理解语言和观察图像,但它们的“肌肉”(动作模块)却几乎是从零开始,没有任何关于如何运动的先验知识。
解决方案:“蒙眼”练习先行
作者提出了一个两阶段的训练方法。与其直接把机器人扔进厨房并交给它一份食谱,不如先让机器人在没有任何食谱或图片的情况下练习移动。
这就像一名舞蹈生。在学习一段特定的音乐舞步(食谱)之前,他们会先在练功房里,在静默中练习基础的步伐、平衡和节奏。他们学习的是身体如何移动、如何转身以及如何停顿。
两个阶段:
第一阶段:“蒙眼”动作课
- 发生了什么: 机器人只接收关于机器人手臂如何移动的数据(轨迹)。它看不见图像,也听不到指令。
- 类比: 这就像一名蒙着眼睛的学徒,一遍又一遍地练习搅拌、抬起和放置物体的物理动作。他们并不是在尝试做某道特定的菜,而是在学习移动的“感觉”。
- 结果: 机器人建立了一种“肌肉记忆”或动作先验(Motion Prior)。它学习了物理的基本规则:“如果我这样移动手臂,物体就会向那里移动。”它学习了运动的流畅感。
第二阶段:烹饪课
- 发生了ها: 现在,机器人拿到了那本食谱(图像和语言指令)。
- 类比: 学徒不再是完全的初学者了。他们已经知道如何握刀以及如何平稳地移动手臂。现在,他们只需要学习根据食谱去使用哪把刀,以及何时进行切割。
- 结果: 因为机器人已经掌握了如何移动,它学习新任务的速度会快得多。它不会把时间浪费在搞清楚基础物理规律上,而是专注于理解指令。
他们是如何连接这两个阶段的
论文使用了三个巧妙的技巧,以确保“动作练习”能对“烹饪课”有所帮助:
- 重用肌肉记忆: 在第二阶段中,机器人用于学习移动的部分被重复利用了。这就像学徒保留了他们在练习中所使用的同一双手和肌肉,而不是换了一套新的手。
- “幽灵”老师: 在第二阶段的开始,机器人会被告知:“记得你在第一阶段是如何移动的吗?试着像那样移动。”这能防止机器人在学习新食谱的过程中出现混乱或不规则的动作。
- “记忆标记(Memory Token)”: 机器人经常会忘记前一秒做了什么。作者创建了一种方法,将机器人最近的历史记录(它做了什么以及看到了什么)压缩成一个单一的、微小的“摘要标记”。这就像学徒手里有一张便签纸,上面写着:“我刚刚抓住了杯子,现在我需要把它抬起来。”这有助于机器人在执行长任务时做出更好的决策。
为什么这很重要(实验结果)
研究人员在 13 种不同的任务上对不同类型的机器人(有些在模拟器中,有些是真实机器人)进行了测试。
- 学习更快: 机器人学习新任务的速度更快,因为它们不必从头开始学习如何移动。
- 更擅长处理困难任务: 最大的收获是在“长尾(long-tail)”任务上——即那些数据非常稀少的任务(例如,一个真实世界的机器人在只有 50 个示例的情况下尝试堆叠杯子)。如果没有这种先验知识,机器人会陷入僵直或动作僵硬。有了这种先验知识,它的动作会变得平滑且成功。
- 稳定性更高: 训练过程更加稳定。所谓的“梯度”(告诉机器人如何改进的数学信号)不再那么混乱,这意味着机器人不会“忘掉”已经掌握的知识。
总结
这篇论文表明,在教机器人“做什么”(目标)之前,我们应该先教它“如何移动”(动作)。通过在“学术课”之前给予机器人一堂“体育课”,它会成为一个更优秀、更快速且更可靠的劳动者,尤其是在它需要处理不同类型的机器人或面对缺乏经验的场景时。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。