← 最新论文
💻 computer science

MoDex: A Diffusion Policy for Sequential Multi-Object Dexterous Grasping

ModEx 是一种两阶段扩散策略,它通过使用一个为未来任务预留自由度的对立空间条件,使灵巧手能够在不释放已持有物体的情况下顺序抓取多个物体,从而在模拟和真实世界实验中均实现了比现有基准更高的成功率。

原作者: Haofei Lu, Hongjia Liu, Yifei Dong, Florian T. Pokorny, Jens Lundell, Danica Kragic

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Haofei Lu, Hongjia Liu, Yifei Dong, Florian T. Pokorny, Jens Lundell, Danica Kragic

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人手就像一位技艺高超的杂耍表演者。通常情况下,当机器人尝试抓取物体时,它们会使用整个手掌——每一根手指都去抓同一个东西。这就像是用一整支搬运工团队来搬运一个咖啡杯。一旦拿到了这个杯子,它们就必须放下或松开它,才能去捡下一个。它们对一个物体“全力以赴”,导致没有多余的手指可以做其他事情。

MoDex 是一个改变游戏规则的新型机器人大脑。它不再是用所有的手指去抓取一个物体,而是学会了成为一名战略性节省者。它只用几根手指(比如仅用大拇指和食指)来拿起一个物体,从而留下其他手指保持空闲并准备就绪。然后,在不松开第一个物品的情况下,它会伸出手,用另一组手指抓住第二个物体,接着是第三个。这就像一个杂耍者接住一个球,用一只手拿着它,同时用另一只手接住第二个球,然后用脚接住第三个,且在此过程中始终没有掉落前两个球。

以下是论文如何通过简单的概念来解释这一奇迹的:

1. “对立空间”(The Opposition Space,规则手册)

MoDex 的秘诀在于作者称之为对立空间 (OS) 的东西。你可以把它理解为每一次抓取的“规则手册”。

  • 在机器人尝试拿起一个物体之前,一条“规则”会告诉它:“对于这个特定的物体,只使用你的大拇指和中指。留下无名指和小指保持空闲。”
  • 这确保了机器人不会意外地使用了它在未来抓取下一个物体时需要的指头。这就像一位厨师只针对特定的菜肴使用特定的刀具,把其他的刀留给后续的课程。

2. “记忆”(Grasp History,抓取历史)

机器人还拥有一个被称为抓取历史 (Grasp History) 的短期记忆。

  • 如果机器人正在拿起第二个物体,它会记得:“我正用大拇指和食指拿着一个球。”
  • 这种记忆防止了机器人再次尝试使用这些相同的指头。它迫使机器人寻找一种新的方式,利用那些目前处于“非值班”状态的指头来抓取下一个物品。

3. “训练营”(两步学习法)

机器人并不是一夜之间学会这项技能的。论文描述了一个两步走的训练过程,类似于人类运动员的训练方式:

  • 第一步:模仿学习(观察专家): 首先,机器人在计算机模拟中观看了几千段类似人类专家的演示视频。它学习模仿这些动作,就像学生临摹老师的手写体一样。这给了它一个良好的起点。
  • 第二步:强化学习(试错法): 然后,机器人被放入了一个“健身房”,让它自主练习。它拥有一个奖励机制:
    • 好: 拿起一个新物体,并且保持旧有的物体不掉落。
    • 坏: 掉落物体、撞击桌面或移动了不该移动的指头。
    • 这一步对机器人进行了精细调整,使其比仅仅模仿视频更加可靠。

4. 结果:模拟 vs. 现实

研究人员在两个地方测试了 MoDex:

  • 在计算机中(模拟): 他们使用了一个虚拟机器人手臂(Franka Panda)和一个灵巧手(Allegro Hand)。他们要求它连续拿起三个物体。MoDex 的表现远优于其他方法,平均成功率约为 56%,而其他方法随着物体数量的增加,表现挣扎甚至完全失败。
  • 在现实世界中: 他们将同样的算法应用到实验室里的真实机器人上。尽管机器人之前从未见过真实的物体(它只在模拟中见过),但它仍然奏效了!它成功抓取了现实世界的物品,尽管表现比在计算机中稍逊一筹(在最难的任务中,成功率从 ~56% 下降到 ~35%)。这证明了“从模拟到现实 (sim-to-real)”的迁移是有效的。

MoDex 目前还做不到的事(局限性)

论文诚实地说明了机器人目前还无法做到的事情:

  • 没有“手中变换”的魔力: 人类可以用两根手指拿起一支笔,然后将其转移到更舒适的握法而不松手。MoDex 做不到这一点。一旦它用特定的手指抓住了物体,它就会一直保持这种握法直到结束。
  • 没有战略规划能力: 机器人不会决定使用哪些手指或先抓取哪个物体。人类负责决策;机器人只是遵循给予它的指令。

大局观

论文总结道,目前的机器人正在“低效利用”它们那些精巧的多指手。通过教它们一次只使用几根手指,并将剩余的手指留给以后使用,我们可以让它们在处理多个物体而不掉落方面变得更加出色。MoDex 是第一个证明这种“序列化节省”策略行之有效的系统,它将笨拙的机器人手变成了一个细心的、能同时处理多项任务的杂耍者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →