Learning Dexterous Manipulation Using Contact Wrench Guidance From Human Demonstration
本文介绍了 CHORD,这是一个利用从人类演示中提取的以物体为中心的接触力矩引导,来实现长程灵巧操控的可扩展强化学习框架,该框架在大规模仿真基准测试中实现了高成功率,并展示了强大的泛化能力和现实世界迁移能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想教一个拥有极其灵巧双手(像人类一样)的机器人如何执行复杂的任务,例如打开一个棘手的盒子、搅拌浓稠的面糊或翻动书页。你有一段人类完美完成这些任务的视频。问题在于,机器人的手形状不同,关节数量也不同,触摸物体的位置也与人类不同。如果你只是告诉机器人:“完全模仿人类的手部动作,”它将会失败,因为它的手在物理上无法达到或移动到同样的位置。
这篇论文介绍了一种名为 CHORD(来自人类演示的接触力矩引导,Contact Wrench Guidance from Human Demonstration)的新方法来解决这个问题。以下是其工作原理的简单解释:
核心问题:“复制了错误的东西”
把人类的手和机器人手想象成两种不同的乐器。如果人类弹钢琴,他们的手指会按下特定的琴键。如果你试图让小提琴做出完全相同的指法动作,它发出的声音是不对的。
以往的方法试图通过将人类手指的位置与物体进行匹配来教导机器人。它们说:“如果人类的拇指触摸了盒子的左上角,那么你的机器人拇指也必须触摸左上角。”
- 缺陷: 有时,即使机器人的拇指触摸了同一个左上角,也会因为机器人的手指形状不同,导致把盒子推向错误的方向,或者从上面滑落。虽然位置相同,但效果是错误的。
解决方案:关注“推力”,而非“触碰”
CHORD 改变了问题的切入点。它不再问“人类在哪里触摸?”,而是问:“那次触摸对物体做了什么?”
我们使用了一个概念叫做接触力矩空间(Contact Wrench Space)。想象每一次手触摸物体时,都会产生一种特定的“推力和扭转力”。
- 类比: 想象一扇门。你可以推门把手(位置 A),也可以推门的边缘(位置 B)。这是两个不同的位置,但如果你都朝正确的方向推,它们都能让门转动开启。
- CHORD 的妙招: 它忽略了机器人在哪里触摸,而是专注于触摸所产生的力和扭转(即“力矩/wrench”)。它告诉机器人:“你不需要触摸与人类完全相同的点,你只需要创造出相同的摆动动作(比如门转动的动作)即可。”
这使得机器人能够找到自己独特的触摸物体的方式,只要结果(物体运动正确)与人类的目标相符即可。
他们是如何教导机器人的(“健身房”)
为了训练机器人,研究人员不仅仅使用了几段视频。他们构建了一个庞大的数字健身房(模拟环境),其中包含 4,739 个不同的任务。
- 这些任务涵盖了从简单的事情(拿起一个杯子)到复杂的长序列任务(打开一个盒子,取出一种工具,然后使用它)。
- 他们使用人类完成这些任务的视频作为“参考指南”。
- 机器人在这个模拟器中进行了数百万次的练习,尝试去匹配人类动作的“力和扭转”,而不是仅仅模仿他们的手指位置。
结果:全能大师
当他们在 1,831 个不同任务上测试机器人时:
- 成功率: 机器人的平均成功率达到了 82%。这比以往的方法有了巨大的提升。
- 多功能性: 它在刚性物体(如锤子)、关节类物体(如带合页的门)甚至需要双手协作的任务中都能奏效。
- 现实世界: 他们将机器人从计算机中带出来,应用到了真实的机器人上。它在“开环”(执行预设序列)和“闭环”(对正在发生的世界做出反应)模式下都表现出色。
额外奖励:教导全身动作
这种方法非常灵活,即使你只向机器人展示人类手部的视频(而不展示身体部分),它也能奏效。机器人可以计算出如何移动其整个身体,以便将手部置于正确的姿态,从而产生必要的力。它甚至可以处理从第三人称视角拍摄的视频(从房间另一头观察某人),即便这些视频中的手部动作有些模糊。
总结
简而言之,CHORD 教会了机器人成为创造性的问题解决者,而不仅仅是盲目的模仿者。它不是强迫机器人模仿人类精确的手指摆放,而是教会机器人模仿动作背后的物理特性。这使得机器人能够利用其独特的身体来实现与人类相同的目标,使其在处理复杂的现实世界物体时表现得更加出色。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。