← 最新论文
💻 computer science

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

本文提出了一种基于头相机坐标系内相对腕部平移的桥接动作表示方法,并结合视觉-语言-动作模型,通过克服噪声较大的 6DoF 位姿估计以及根本性的具身差异,将多样化的人类操控技能有效地迁移至双臂机器人。

原作者: Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一个笨拙的机器人完成复杂的厨房家务,比如打开微波炉、叠放杯子或擦拭柜台。你有两个选择:要么花费数千美元记录机器人执行这些任务的过程(这既慢又贵),要么记录人类完成这些任务的过程(这既便宜又容易获取且数据丰富)。

核心问题在于,人类和机器人的构造非常不同。

  • 人类拥有灵活的手指,可以进行无限种方式的扭转、旋转和抓握。
  • 本研究中的机器人则拥有“平行夹持器”——基本上就是两个只能张开和闭合的僵硬钳子。

如果你试图直接将人类手部的动作复制到机器人身上,就像是在试图通过展示人类手指的方式来教一只狗弹钢琴。机器人会感到困惑,因为人类使用的那些“扭转”动作对于它僵硬的钳子来说毫无意义。机器人最终会变得手忙脚乱,或者做错动作。

解决方案:“作为桥梁动作的平移”

研究人员想出了一个聪明的技巧,称为**“桥梁动作”(Bridging Action)。他们决定不再尝试复制整个人类手部(包括那些令人困惑的扭转和旋转),而是只复制手腕的直线运动(平移)**。

可以这样理解:

  • “多噪”的方式(旧方法): 尝试复制人类手部的精确 3D 旋转和角度。这就像是在不理解诗歌含义的情况下进行逐字翻译;听起来是对的,但意思全错了。
  • “桥梁”的方式(新方法): 忽略旋转,只关注手部在空间中移动的位置(左、右、上、下)。这就像是翻译诗歌的“含义”,而不是具体的“词汇”。

通过专注于平移(从 A 点移动到 B 点)并忽略旋转(扭转),研究人员找到了一个人类和机器人都能理解的“共同语言”。

他们是如何构建这个“翻译器”的

为了实现这一目标,他们构建了一个特殊的 AI 模型(视觉-语言-动作模型),充当一个通用翻译器。其工作原理分为简单的三个步骤:

  1. “桥梁”信号: 他们提取人类的手腕运动,将其转化为简单的 3D 路径(就像在地图上画一条线)。这就是“桥梁”,因为无论是人类还是机器人,都能理解“向前移动”或“向左移动”,即便他们的移动方式不同。
  2. “交错式”训练: AI 在混合数据上进行训练。有时它看到人类移动手部(此时它只学习路径);有时它看到机器人移动手臂(此时它学习完整的路径加上钳子的抓握动作)。这个 AI 非常聪明,能够处理缺失的信息,就像一位厨师即使缺少一种特定的香料也能做出美味佳肴一样,通过利用现有的食材来完成烹饪。
  3. “绑定”技巧: 为了确保机器人确实学会了如何正确移动它的钳子,AI 被迫练习在利用简单的“人类路径”作为引导的同时,去预测机器人的完整动作。这就像学生通过先在模拟器上练习转向,然后再切换到真实的汽车上,但保留了同样的转向逻辑。

他们的发现

他们在 15 种不同的任务上进行了测试,从打开微波炉到叠放杯子。结果如下:

  • 没有桥梁: 如果他们只是尝试复制机器人自身的有限数据,机器人几乎在所有任务上都会失败。
  • 有了桥梁(人类数据): 当他们使用这种“仅平移”的人类数据来教授机器人时,机器人的表现突然变好了。它能够完成从未见过的任务,比如打开微波炉或叠放杯子。
  • “旋转”问题: 当他们尝试使用完整的、带有噪声的人类手部旋转(即“多噪”方式)时,机器人的动作变得扭曲且笨拙,就像一个被缠乱了线的木偶。事实证明,简单的“平移”方法效果要好得多。
  • “上限”测试: 他们还测试了如果喂给机器人“完美的”机器人数据,但将其视为人类数据处理(即忽略机器人的特定相机视角)会发生什么。结果显示机器人变得更强了,这表明如果我们能获得更干净的数据,这种方法可能会更加强大。

核心结论

这篇论文证明了,你不需要完美地模仿人类的身体结构来教机器人。你只需要找到共享的运动(手部经过的路径),并忽略那些不匹配的部分(扭转手指)。

通过使用这种“桥梁动作”,研究人员成功地将技能从廉价、丰富的人类视频转移到了机器人身上,使机器人无需成千上万次昂贵的机器人演示即可学习复杂的任务。这相当于在说:“不要担心人类是如何握住杯子的;只需教会机器人要把杯子放在哪里。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →