← 最新论文
💻 computer science

DexSynRefine: Synthesizing and Refining Human-Object Interaction Motion for Physically Feasible Dexterous Robot Actions

DexSynRefine 是一个耦合框架,它通过利用用于轨迹生成的运动先验以及具有接触动力学自适应的任务空间强化学习,从稀疏的人机交互数据中合成符合物理可行性的灵巧机器人动作,从而使真实世界的成功率比运动学重定向提高 50–70 个百分点。

原作者: Hyesung Lee, Hyunwoo Jung, Si-Hwan Heo, Sungwook Yang

发布于 2026-06-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Hyesung Lee, Hyunwoo Jung, Si-Hwan Heo, Sungwook Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一个拥有类人手的机器人完成一项精细的任务,比如拿起一把锤子或从浇水壶中倒水。你可以尝试记录人类完成动作的过程,但这里有一个巨大的问题:人类的手和机器人的手构造不同,而且我们拥有的数据通常是稀疏的(我们只有寥寥几个视频),并且是运动学的(它只展示了物体移动的轨迹,却没展示出抓握时的力度或那些看不见的力)。

如果你只是让机器人完全模仿人类的动作,它通常会失败,因为它并不理解物理规律或自身的机械极限。

这篇论文介绍了 DexSynRefine,这是一个将稀疏的人类视频转化为成功的机器人动作的“三步走配方”。你可以把它看作是一个三阶段的翻译过程:

1. “创意总监”:合成计划 (HOI-MMFP)

问题: 你只有几个关于人类拿起瓶子的视频。如果瓶子的位置稍微变了一下呢?机器人就不知道该怎么办了。
解决方案: 该系统充当一名创意总监,观察你提供的少量视频,并构思出数百个相同任务的新版本。

  • 类比: 想象你向一位导演展示了一张关于人开门的草图。导演并不仅仅是复制那张草图;他们利用自己对门如何运作的知识,想象出这个人是从左边、右边开门,甚至是在门稍微重一点的情况下是如何开门的。
  • 作用: 它获取你稀疏的人类数据,并生成一段平滑且连贯的“电影”,展示手部相对于物体应该如何移动,无论物体的初始位置在哪里。它填补了空白,为机器人提供了一个完整的计划。

2. “物理教练”:落地计划 (Task-Space Residual RL)

问题: 即使有了完美的“电影计划”,机器人也可能因为不理解摩擦力或重量,而做出导致自身关节损坏或在物体上打滑的动作。
解决方案: 系统引入了一位“物理教练”,通过观察计划来进行实时的微调。

  • 类比: 想象一位舞蹈教练。学生(机器人)试图遵循编舞(合成的计划)。教练并不会重写整个舞蹈,而是通过在这里轻轻推一下学生的胳膊,或者在那里调整一下他们的抓握,来确保他们不会绊倒或撞到墙。
  • 作用: 它获取第一步生成的“电影”计划,并添加微小的“残差”调整。它学习到:“好吧,计划说在这里抓取,但因为摩擦力的存在,我需要稍微用力捏紧,或者稍微改变一下手腕的移动方式。”这确保了动作在物理层面上是可行的。

3. “直觉飞行员”:适应现实 (Contact & Dynamics Adaptation)

问题: 在计算机模拟中,机器人清楚地知道物体的重量以及它是否接触到了桌面。但在现实世界中,机器人的传感器无法“看到”这些无形的力。这就像闭着眼睛开车,靠猜测路况一样。
解决方案: 系统教会机器人通过自身的身体运动(本体感觉)来“感知”世界。

  • 类比: 想象一位蒙着眼睛的钢琴家。他们看不见琴键,但可以通过感受琴弦的振动和琴键的阻力,准确地知道自己在哪里,以及按下的力度有多大。
  • 作用: 机器人观察自身运动的历史记录(它的手臂和手指是如何移动的),以此来推测物体正在发生什么。是锤子撞到了钉子吗?还是水正在晃动?它利用这些推测来即时调整抓握力和力度,使其能够在现实世界中工作,而不需要依赖计算机模拟提供的“作弊表”。

结果

当研究人员将这个三步走过程应用于五项困难任务(如重新定向一个薯片罐或钉钉子)时,结果非常显著:

  • 旧方法(仅仅复制人类动作): 机器人的成功率不到 10%。它会掉落物体或抓取失败。
  • DexSynRefine: 机器人的成功率提升了 50% 到 70%。

简而言之: DexSynRefine 不仅仅是告诉机器人“模仿人类”。它构思出一个完整的计划,教授机器人动作中的物理原理,并训练机器人通过感知来应对现实世界,从而将寥寥几个人类视频转化为可靠的机器人技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →