← 最新论文
💻 computer science

Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Control

本文提出了一种迭代闭环框架,该框架可自动生成高质量、多样化的运动数据并逐步增加任务难度,从而使人形机器人控制策略在训练数据大幅减少的情况下,性能显著优于基线方法。

原作者: Weisheng Xu, Qiwei Wu, Jiaxi Zhang, Tan Jing, Yangfan Li, Yuetong Fang, Jiaqi Xiong, Kai Wu, Rong Ou, Renjing Xu

发布于 2026-03-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Weisheng Xu, Qiwei Wu, Jiaxi Zhang, Tan Jing, Yangfan Li, Yuetong Fang, Jiaqi Xiong, Kai Wu, Rong Ou, Renjing Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人跳舞、格斗或做体操。通常,你会通过向它展示成千上万段人类进行这些活动的视频来实现。但这种方法存在两个大问题:

  1. “简单模式”陷阱:我们拥有的大多数视频都是人们走路、挥手或执行简单日常任务的片段。机器人对这些非常擅长,但当你要求它做后空翻或复杂的武术踢腿时,它会摔倒,因为它在训练中从未见过这些动作。
  2. “昂贵教练”问题:要获取专家执行酷炫高难度动作的视频,你需要昂贵的动作捕捉服和专业工作室。你无法拍摄数百万小时的这类内容;这既耗资巨大又耗时。

解决方案:一个自我进化的“电子游戏”循环

本文作者 CLAIMS 构建了一个系统,其运作方式如同一个机器人和游戏关卡共同进化的电子游戏

以下是其工作原理,使用一个简单的类比:

1. 机器人(玩家)

将机器人视为一个电子游戏角色。它的任务是完美地模仿特定的动作。

2. AI 导演(游戏设计师)

团队不使用人类来拍摄新动作,而是利用一个 AI“导演”(一个动作生成模型)。这位导演只需阅读文字描述(例如“高速三圈旋转”),就能发明新的舞蹈动作、武术连招或体操套路。

3. “教练”(反馈循环)

这是神奇的部分。系统在一个循环中运行:

  • 步骤 1:导演生成一个新的、略微棘手的动作。
  • 步骤 2:机器人尝试模仿它。
  • 步骤 3:“教练”(一个能够观看并理解视频的智能 AI)观察机器人。它会问:“机器人摔倒了吗?这个动作是否太简单了?它看起来像描述的那样吗?”
  • 步骤 4:根据教练的报告,导演获得新的指令:“机器人已经掌握了简单的跳跃。现在,生成一个难度增加 20% 且涉及旋转的动作。”

4. 结果:一个“升级”系统

就像在游戏中你通关后下一关会变得更难一样,这个系统不断推动机器人进步。

  • 迭代 1:机器人学会走路和做简单的转身。
  • 迭代 2:系统意识到机器人已熟练掌握这些,于是生成更难的动作(如侧手翻)。
  • 迭代 3:机器人掌握了侧手翻,因此系统生成“带旋转的后空翻”。

由于该系统自动生成其自身的“更高难度关卡”,它不需要昂贵的人类教练或庞大的预录视频库。它构建了自己的训练课程。

他们取得了什么成就?

团队在一个从零开始学习的机器人上测试了该系统。

  • 效率:他们仅使用了通常所需数据量的十分之一(与 AMASS 等标准数据集相比)。
  • 性能:在他们的“游戏”结束时,与采用传统方法训练的机器人相比,该机器人在高难度专业动作(如功夫或复杂舞蹈)上的失败率降低了 45%
  • 通用性:他们证明了该方法适用于多种不同类型的困难动作,包括武术、舞蹈、格斗、运动和体操。

核心结论

与其试图在库中寻找所有可能的困难动作(这既不可能又昂贵),本文提出了一种自动驾驶训练循环。它生成机器人需要学习的困难动作,测试机器人,然后根据机器人刚刚学到的内容立即生成更难的动作。这是一种无需满场人类专家,就能将机器人培养成专业运动员的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →