← 最新论文
🤖 machine learning

A Minimalist Retargeting-Guided Reinforcement Learning Recipe for Dexterous Manipulation

本文介绍了 REGRIND,这是一个结合了重定向引导的强化学习与零样本实机迁移的极简流水线,旨在通过仅需单次人类演示,实现多指机器人在接触密集型灵巧操作任务中的表现。

原作者: Yunhai Feng, Natalie Leung, Jiaxuan Wang, Lujie Yang, Haozhi Qi, Preston Culbertson

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunhai Feng, Natalie Leung, Jiaxuan Wang, Lujie Yang, Haozhi Qi, Preston Culbertson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一个机械手如何使用剪刀或转动螺丝刀。你可以尝试手动编写每一个手指的动作,但这就像是在蒙着眼睛试图通过一次只打一个字母的方式来写一部小说。相反,这项名为 REGRIND 的研究背后的研究人员尝试了一个简单得多的技巧:他们要求人类做一次该动作,将其记录下来,然后教机器人模仿那一次表演。

但问题在于:人类的手和机器人的手构造不同。如果你只是告诉机器人,“让你的手指移动以匹配人类的形状”,你可能会得到一个试图穿过桌面去握住螺丝刀,或者是在抓空而不是抓工具的机器人手。这就像是告诉一只猫要像狗一样游泳;形状可能看起来对了,但物理机制却是一场灾难。

“保持交互”的秘密武器
该论文的主要发现是,要让这套方法奏效,你不能仅仅复制手的“形状”,你必须复制手与物体之间的“关系”。作者们称之为“保持交互的重定向”(interaction-preserving retargeting)。

可以这样理解:如果一个人拿着剪刀,他们的手指是环绕在手柄上的,且刀片是张开的。如果你只是告诉机器人把手指放在同样的位置,它可能会不小心压碎剪刀,或者因为感受不到张力而掉落工具。REGRIND 方法构建了一个数字“安全网”(称为“交互网格”,interaction mesh),使机器人的手指保持在相对于工具的正确位置,确保机器人不会以一种物理上不可能的方式去抓取物体。

配方:一次演示,无限练习
这个过程出奇地极简。他们使用了一次单一的人类演示(一段人使用工具的视频)。

  1. 重定向(Retargeting): 他们将那个人类的动作转换成了一种符合机器人物理特性、且尊重抓取工具物理规律的路径。
  2. “如果……会怎样”的游戏: 由于他们只有一个样本,所以使用了一个聪明的技巧来创造数千次练习。他们设想工具起始位置略有不同(偏移最多 5 厘米 或倾斜 30 度),并教会机器人如何调整其路径以依然取得成功。这就像练习投篮时,不仅要在罚球线练习,还要在稍微偏左、稍微偏右和稍微靠后的位置练习,这样如果球弹跳得有点奇怪,你也不会慌乱。
  3. 模拟训练: 机器人在类似电子游戏的模拟环境中进行了数百万次的练习,学习完美地追踪工具的运动。

奏效了吗?现实检验
结果令人印象深刻,但也带有几个重要的星号(注意事项)。在模拟器中,机器人表现得像个超级明星。在像使用 WUJI 手进行螺丝刀操作的任务中,它的成功率达到了 99.7%。即使是更复杂的剪刀任务,它也达到了 98.7% 的成功率。机器人学会了流畅地移动,几乎像人类一样。

然而,当他们将机器人从“电子游戏”移到现实世界时,情况变得有些坎坷。

  • 好消息: 在四项现实世界测试中的三项中,机器人的表现非常出色。它成功使用 LEAP 手进行剪切任务(10 次中成功 9 次)以及转动螺丝刀(10 次中成功 10 次)。它在使用 WUJI 手完成螺丝刀任务时也表现良好(10 次中成功 9 次)。
  • 坏消息: 它在 WUJI-剪刀 任务上完全失败了(10 次中成功 0 次)。作者怀疑这是因为现实中的剪刀与数字模型并不完全匹配,且机器人的电机过于僵硬,无法进行调整。
  • 对比: 他们测试了其他未使用这种“保持交互”技巧的方法。那些方法就像是只会死记硬背答案而并不理解数学原理的学生。在现实世界中,它们几乎每次都失败(在大多数任务中成功率为 0%),通常是因为它们尝试抓取工具的方式导致机器人撞到了桌子。

这意味着什么(以及不意味着什么)
论文表明,如果你想让机器人学习一项复杂的、涉及大量接触的任务,你需要教它手是如何接触物体的,而不仅仅是手指在哪里。他们证明了,只要处理得当,一次人类演示就足以教会机器人完成这些任务。

但先别指望现在就能拥有一个机器人管家。该系统仍然需要一台动作捕捉相机来实时告知它工具的确切位置;它目前还不能仅凭普通的摄像头就“看到”工具。此外,如果现实世界的物体与数字模型不完全匹配(例如 WUJI-剪刀的失败案例),机器人就会陷入困境。

简而言之,作者找到了一套配方,能将一段人类视频转化为一项可行的机器人技能,但在现实世界中要实现这一点,机器人仍需要来自相机和物体完美数字孪生的辅助。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →