← 最新论文
💻 computer science

DreamControl-v2: Simpler and Scalable Autonomous Humanoid Skills via Trainable Guided Diffusion Priors

本文提出了 DreamControl-v2,一种通过直接在机器人运动空间训练可引导扩散先验并聚合多源数据,从而简化流程、扩展技能范围并提升人形机器人自主 loco-manipulation 能力的可扩展框架。

原作者: Sudarshan Harithas, Sangkyung Kwak, Pushkal Katara, Srujan Deolasee, Dvij Kalaria, Srinath Sridhar, Sai Vemprala, Ashish Kapoor, Jonathan Chung-Kuan Huang

发布于 2026-04-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Sudarshan Harithas, Sangkyung Kwak, Pushkal Katara, Srujan Deolasee, Dvij Kalaria, Srinath Sridhar, Sai Vemprala, Ashish Kapoor, Jonathan Chung-Kuan Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 DreamControl-v2 的新系统,它的目标是让人形机器人(比如 Unitree G1)能像人一样,自主地学会各种复杂的技能,比如“打开抽屉”、“深蹲捡东西”或者“出拳”。

为了让你更容易理解,我们可以把机器人学习技能的过程想象成教一个刚出生的婴儿学动作。

🌟 核心故事:从“照猫画虎”到“量身定制”

1. 旧方法(DreamControl v1):笨拙的“翻译官”

以前的方法(DreamControl v1)就像是一个只会说人类语言的翻译官。

  • 流程:研究人员先让 AI 生成一个“人类”的动作视频(比如人类去开门),然后试图把这个人类动作“翻译”给机器人。
  • 问题:
    • 体型不同:人类和机器人的身体结构不一样(腿长、关节位置都不同)。直接翻译往往会导致机器人动作变形,手够不到门把手,或者重心不稳摔倒。
    • 试错成本极高:为了让机器人手刚好碰到门把手,研究人员得像个调音师一样,反复调整输入给 AI 的指令(“把手抬高一点”、“再低一点”),试了上百次才能凑出一个勉强能用的动作。这就像为了教机器人开门,你得先猜一百次人类该站多远,太累太慢了。
    • 数据局限:旧系统主要学习的是人类日常走路的动作(AMASS 数据集),对于“开门”、“拿东西”这种复杂的互动动作,它根本没见过,所以学不会。

2. 新方法(DreamControl v2):天生的“机器人教练”

DreamControl-v2 彻底改变了思路。它不再让机器人去模仿人类,而是直接教机器人自己。

  • 核心创新:先“变身”,再“学习”
    想象一下,我们不再把人类动作直接丢给机器人,而是先在一个巨大的工厂里,把成千上万个不同来源的人类动作视频(包括走路、跳舞、甚至抓东西),全部通过一个自动化的“变身机器”(Retargeting),提前转换成机器人视角的动作。

    • 这就好比,我们不再让机器人去猜“人类怎么开门”,而是直接给机器人看“机器人怎么开门”的教材。
    • 这个教材是由海量数据(人类动作 + 机器人遥操作数据)混合而成的,涵盖了各种复杂的场景。
  • 训练“机器人大脑”
    在这个转换好的“机器人动作教材”上,我们训练了一个扩散模型(Diffusion Model)。你可以把它想象成一个超级动作教练。

    • 当你告诉教练:“去把抽屉打开”,它不需要再猜人类怎么动,而是直接根据它学过的“机器人动作库”,生成一条完美的、符合机器人身体结构的动作轨迹。
    • 关键点:它生成的动作天生就是为机器人设计的,不需要再经过繁琐的“翻译”和“试错调整”。

🚀 这个新方法带来了什么好处?

  1. 更简单(Simpler):
    以前需要人工反复调整参数(试错),现在完全自动化。就像以前你要手动调收音机找频道,现在直接有了“一键搜索”功能。

  2. 更强大(Scalable):
    因为训练数据更丰富(不仅有人类走路,还有各种抓握、互动的数据),机器人能学会以前学不会的复杂技能。比如“深蹲捡东西”这种需要全身协调的动作,旧系统搞不定,新系统却轻车熟路。

  3. 更稳健(Robust):
    论文在仿真环境和真实的 Unitree-G1 机器人上做了测试。结果显示,用新系统生成的动作去训练强化学习(RL)策略,机器人完成任务的成功率非常高(比如开门成功率 96%,深蹲捡东西 94%),而且动作非常自然,不会像旧方法那样经常摔倒或动作怪异。

🎯 总结:一个生动的比喻

  • 旧方法:就像你让一个只会开轿车的司机去开卡车。你只能告诉他:“把方向盘往左转,就像开轿车那样”,然后他得在路边反复试,撞几次墙才能勉强把车停进卡车的位置。
  • 新方法(DreamControl-v2):我们直接给这个司机发了一本卡车驾驶手册,里面全是卡车怎么开、怎么转弯、怎么换挡的详细教程。他看完后,直接就能熟练地驾驶卡车,不需要再试错,也不需要别人在旁边指挥。

一句话总结:
DreamControl-v2 通过把人类动作提前“翻译”成机器人语言,并训练一个专为机器人设计的动作生成大脑,让人形机器人能更简单、更快速地学会各种高难度的干活技能,真正走向了自主化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →