← 最新论文
💻 computer science

NestDex: Nested Policy Learning with Copilot Assisted Teleoperation for Dexterous Manipulation

NestDex 是一个嵌套式策略学习框架,它通过允许操作员控制机械臂并利用离合器选择高层手部技能,简化了灵巧操作数据的采集过程,从而生成可靠的演示数据以训练自主视觉运动策略。

原作者: James Zhao, Jinhe Tang, Mingyuan Ba, Weiming Zhi

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: James Zhao, Jinhe Tang, Mingyuan Ba, Weiming Zhi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机械手的舞步

想象一下,试图教一个机器人完成像剥葡萄皮或穿针引线这样精细的动作。这不仅仅是让机械臂从 A 点移动到 B 点的问题,更关乎机器人的手指。在机器人领域,这被称为“灵巧操纵”(dexterous manipulation)。普通的机器人夹持器就像一对只能张开和闭合的镊子,而灵巧手则拥有许多关节,就像人类的手一样,需要复杂的协调能力来触摸、握持和旋转物体而不将其捏碎。

教机器人这些技能最大的障碍并不是因为机器人太笨学不会,而是因为向它们展示“如何做”极其困难。要通过示范(一种称为模仿学习的方法)来教机器人,人类必须在机器人观察的同时完美地执行任务。但对于灵巧手来说,这简直是一场噩梦。人类操作员必须在控制机器人手臂转向的同时,还要协调每一个手指关节以保持轻柔的抓握。这就像是一个人用一只手开车,同时用另一只手弹奏一段复杂的钢琴独奏。如果人类稍有差池,数据就会作废,机器人也将一无所获。本文探讨的正是一个核心问题:我们如何让机器人学会这些花哨的手指技巧,而不至于让操作员抓狂?

认识 NestDex:机器人的“副驾驶”

这项研究背后的研究人员 James Zhao 及其团队推出了一种名为 NestDex 的新系统。你可以把它想象成给机器人的手指配备了一个“副驾驶”。与其要求人类直接控制每一个手指的运动,NestDex 将工作分解为两个部分。人类操作员仍然控制大动作——控制手臂的方向并决定去向——而手指则由一个智能的、预训练好的“内部策略”(inner policy)来处理。

想象你在驾驶一辆配备了高级巡航控制系统的汽车,该系统知道如何绕过路面上的坑洼。你只需要告诉汽车“前进”,巡航控制系统就会处理方向盘微小且快速的调整,以保持行驶平稳。在 NestDex 中,人类使用一个简单的“离合器”(单一控制装置)来告诉机器人的手指,某个特定技能应该进行到什么程度。如果人类向前推动离合器,机器人的手指会自动执行一个预先学到的技能,比如“抓取瓶子”或“按下按钮”。如果人类向后拉,机器人就会倒回手指的运动过程。人类不需要知道如何捏住纸杯,只需要知道何时按下离合器来启动“捏取”技能即可。

这个系统分为两个层级运行。首先,团队使用这种“副驾驶”方法收集数据。人类引导手臂并切换手指技能,从而创建出一套完美的演示库。然后,他们训练一个单独的“外部策略”(outer policy)来完全接管任务。这个外部策略是机器人在执行最终任务时的“大脑”;它从副驾驶的演示中学习,但最终会独立掌控全局,无需任何人类帮助或副驾驶系统,就能同时控制手臂和手指。

压缩与平滑的魔力

NestDex 使用的一个聪明技巧是“手部动作变分自编码器”(简称 H-VAE)。你可以将其理解为一种针对机器人运动的压缩算法。机器人的手有 20 个关节,这意味着有数百万种移动方式。试图教机器人一次性预测 20 个数字,就像要求一名学生逐页背诵整本百科全书。H-VAE 将这些复杂的指部运动压缩成一个更小、更简单的“秘密代码”(潜在动作),这使得机器人更容易学习。当机器人准备执行任务时,它会将这个秘密代码解码回完整的 20 关节运动。研究发现,使用这种压缩技术让机器人学习得更快,表现也比直接学习原始、复杂的运动要好得多。

研究人员还测试了机器人如何处理现实世界的物理特性,例如当手指接触到光滑物体时。他们对比了机器人运动的三种方式:

  1. 固定回放(Fixed Replay): 严格按照录制的成功动作视频进行回放。
  2. 闭环控制(无平滑处理,Closed-Loop No Smoothing): 机器人观察当前位置并决定下一步动作,但动作呈现出断断续续、一顿一顿的状态。
  3. 带有时间集成(Temporal Ensembling)的闭环控制: 机器人观察自己的位置并做出预测,但随后会将该预测与其近期的预测进行平均,从而使运动变得平滑。

结果非常明确。“固定回放”法经常失败,因为如果物体的位置与预期稍有偏差,机器人就会撞击。 “闭环控制”法虽然更具鲁棒性,但动作很生硬。而“时间集成”法成为了赢家:它既平滑又具有适应性。在抓取水瓶的测试中,这种平滑且具适应性的方法成功率高达 9/10,而固定回放法的成功率仅为 3/10。这表明,为了处理精细任务,机器人需要能够实时调整抓握力度,并且要做到平滑调整,而不是仅仅重放剧本。

从副驾驶到单人飞行员

团队在六个不同的挑战性任务上测试了 NestDex,范围涵盖了从使用夹子移动胡萝卜到在活页夹中整理文件。他们将这种“副驾驶”系统与人类尝试直接控制手指的标准方法(称为 AnyTeleop)进行了对比。结果令人震惊。标准方法在某些任务上完全失败,例如在收集“准备吐司”或“整理活页夹”的优质演示数据时,成功率为 0%。相比之下,NestDex 在所有六个任务中收集演示的成功率均为 100%。

更重要的是,论文证明了 NestDex 收集的数据确实有效。当他们利用 NestDex 的数据训练机器人独立完成任务时,机器人在“夹子传输”和“配料传输”任务中达到了 100% 的成功率。即使对于难度更高的任务,其成功率也显著高于使用标准方法收集的数据。论文明确反对了“机器人在执行最终任务时仍需运行副驾驶系统”的观点;副驾驶只是一个用于收集数据的工具。一旦机器人学会了“外部策略”,它就可以利用紧凑的“秘密代码”和学到的平滑、自适应控制策略,独立完成任务。

简而言之,NestDex 表明我们不需要强迫人类成为专业的“机器人手指舞者”。相反,我们可以给他们一个简单的遥控器,通过触发智能的、预先学到的手指技能来进行操作。这使得收集机器人学习所需的高质量数据变得更加容易,并由此产生出能更好地处理复杂物理世界的机器人。作者发现,这种方法不仅让数据收集变得更快、更可靠,还让机器人能够真正自主地掌握精巧的动作任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →