← 最新论文
💻 computer science

Direct Dynamic Retargeting for Humanoid Imitation Learning from Videos

本文提出了直接动态重定向(DDR),这是一种新颖的单阶段框架,它绕过传统流程的几何偏差,直接从单目视频生成高保真且动力学可行的人形轨迹,从而提高模仿精度并加速强化学习的收敛。

原作者: Constant Roux, Ludovic De Matteïs, Armand Jordana, Valentin Guillet, Nicolas Mansard, Olivier Stasse, Philippe Souères

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Constant Roux, Ludovic De Matteïs, Armand Jordana, Valentin Guillet, Nicolas Mansard, Olivier Stasse, Philippe Souères

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教机器人跳舞或表演武术。最简单的方法是给它看一段人类做该动作的视频。但问题在于:人类和机器人的构造截然不同。人类拥有灵活的脊柱和柔软的关节;而机器人则由刚性金属杆和电机组成。如果你只是告诉机器人“完全复制人类的臂部位置”,它可能会试图扭曲其金属躯体,导致损坏、摔倒,或者因电机力量不足而根本无法完成动作。

本文介绍了一种名为**直接动态重定向(Direct Dynamic Retargeting, DDR)**的新方法,以解决这一“翻译”难题。其工作原理可拆解为以下简单概念:

问题所在:“糟糕的翻译者”

目前,大多数机器人采用两步流程从视频中学习,作者将其比作一位在句子中间卡住的翻译者。

  1. 第一步(几何步骤): 系统首先观察人类视频,并询问:“机器人能在物理上做出的、最接近人类手臂和腿部位置的动作姿态是什么?”它忽略了机器人是否真的能在那种姿态下保持平衡。这就像要求人类单腿站立并手持重物,却只检查其腿部是否处于正确形状,而不考虑其是否会摔倒。
  2. 第二步(物理步骤): 随后,第二个系统试图修正第一步的结果。它将该“近乎正确”的姿态纳入计算机模拟中,尝试使其在物理上可行。

缺陷: 作者指出,第一步造成了“偏差”。由于机器人在第一步中被强制塑造成特定形状,第二步便陷入困境。它无法找到最佳的运动方式,因为它被困在试图修正一个原本就错误的形状上。这就像试图画一个完美的圆,却从方形轮廓开始;无论多么努力地平滑边缘,它永远无法成为一个真正的圆。

解决方案:“直接架构师”

作者的新方法DDR完全跳过了中间环节。

它不再询问“机器人最接近人类的姿态是什么?”然后再进行修正,而是提出一个不同的问题:“机器人如何运动,既能看起来像人类,又能遵循物理定律?”

  • 类比: 想象你是一位建筑师,试图建造一座外观酷似著名悬索桥的桥梁,但使用不同的材料(以钢代石)。
    • 旧方法: 你完全复制石桥的形状,然后尝试用钢材加固它。结果可能摇晃不稳,或需要不可能实现的支撑。
    • DDR 方法: 你审视石桥的功能(它如何跨越间隙),并从头设计一座钢桥,以实现相同的效果,同时确保其完全符合钢材的物理特性。你并不强迫钢材看起来像石头;而是让钢材的物理特性引导设计,同时保持整体外观。

实际运作方式

该系统在物理模拟器中使用一个“智能猜测器”(基于采样的求解器)。它并非仅计算一条路径,而是尝试成千上万种机器人可能的运动方式。它保留那些满足以下条件的方案:

  1. 看起来像视频中的人类;
  2. 不会摔倒;
  3. 不会损坏机器人电机;
  4. 使机器人双脚稳固地踩在地面上(无滑动)。

实验结果

团队在真实机器人(Unitree H1-2)上测试了该方法,并与旧方法进行了比较。

  • 更少摔倒: 旧方法生成的指令常导致机器人摔倒或脚部滑动。而 DDR 生成的指令在 99% 的情况下物理上是安全的。
  • 更高精度: 由于 DDR 不再被困于修正“错误”的起始形状,机器人能够更紧密地跟踪人类动作。
  • 更快学习: 当使用这些新指令通过人工智能(强化学习)训练机器人时,机器人学习速度更快,表现优于使用旧指令时的情况。
  • 现实世界成功: 他们成功部署机器人在现实世界中执行复杂动作,如“手枪深蹲”(单腿站立下蹲)和“功夫”姿势,而无需为每个特定动作手动调整代码。

总结

简而言之,本文指出:不要试图强迫机器人完全复制人类的形状,然后再事后修正物理问题。 相反,应让机器人从一开始就动态地自行决定如何运动,仅将人类视频作为整体外观的参考。这将带来更安全、更精准且学习更快的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →