这篇论文介绍了一个名为 DreamControl-v2 的新系统,它的目标是让人形机器人(比如 Unitree G1)能像人一样,自主地学会各种复杂的技能,比如“打开抽屉”、“深蹲捡东西”或者“出拳”。
为了让你更容易理解,我们可以把机器人学习技能的过程想象成教一个刚出生的婴儿学动作。
🌟 核心故事:从“照猫画虎”到“量身定制”
1. 旧方法(DreamControl v1):笨拙的“翻译官”
以前的方法(DreamControl v1)就像是一个只会说人类语言的翻译官。
- 流程:研究人员先让 AI 生成一个“人类”的动作视频(比如人类去开门),然后试图把这个人类动作“翻译”给机器人。
- 问题:
- 体型不同:人类和机器人的身体结构不一样(腿长、关节位置都不同)。直接翻译往往会导致机器人动作变形,手够不到门把手,或者重心不稳摔倒。
- 试错成本极高:为了让机器人手刚好碰到门把手,研究人员得像个调音师一样,反复调整输入给 AI 的指令(“把手抬高一点”、“再低一点”),试了上百次才能凑出一个勉强能用的动作。这就像为了教机器人开门,你得先猜一百次人类该站多远,太累太慢了。
- 数据局限:旧系统主要学习的是人类日常走路的动作(AMASS 数据集),对于“开门”、“拿东西”这种复杂的互动动作,它根本没见过,所以学不会。
2. 新方法(DreamControl v2):天生的“机器人教练”
DreamControl-v2 彻底改变了思路。它不再让机器人去模仿人类,而是直接教机器人自己。
核心创新:先“变身”,再“学习”
想象一下,我们不再把人类动作直接丢给机器人,而是先在一个巨大的工厂里,把成千上万个不同来源的人类动作视频(包括走路、跳舞、甚至抓东西),全部通过一个自动化的“变身机器”(Retargeting),提前转换成机器人视角的动作。
- 这就好比,我们不再让机器人去猜“人类怎么开门”,而是直接给机器人看“机器人怎么开门”的教材。
- 这个教材是由海量数据(人类动作 + 机器人遥操作数据)混合而成的,涵盖了各种复杂的场景。
训练“机器人大脑”
在这个转换好的“机器人动作教材”上,我们训练了一个扩散模型(Diffusion Model)。你可以把它想象成一个超级动作教练。
- 当你告诉教练:“去把抽屉打开”,它不需要再猜人类怎么动,而是直接根据它学过的“机器人动作库”,生成一条完美的、符合机器人身体结构的动作轨迹。
- 关键点:它生成的动作天生就是为机器人设计的,不需要再经过繁琐的“翻译”和“试错调整”。
🚀 这个新方法带来了什么好处?
更简单(Simpler):
以前需要人工反复调整参数(试错),现在完全自动化。就像以前你要手动调收音机找频道,现在直接有了“一键搜索”功能。
更强大(Scalable):
因为训练数据更丰富(不仅有人类走路,还有各种抓握、互动的数据),机器人能学会以前学不会的复杂技能。比如“深蹲捡东西”这种需要全身协调的动作,旧系统搞不定,新系统却轻车熟路。
更稳健(Robust):
论文在仿真环境和真实的 Unitree-G1 机器人上做了测试。结果显示,用新系统生成的动作去训练强化学习(RL)策略,机器人完成任务的成功率非常高(比如开门成功率 96%,深蹲捡东西 94%),而且动作非常自然,不会像旧方法那样经常摔倒或动作怪异。
🎯 总结:一个生动的比喻
- 旧方法:就像你让一个只会开轿车的司机去开卡车。你只能告诉他:“把方向盘往左转,就像开轿车那样”,然后他得在路边反复试,撞几次墙才能勉强把车停进卡车的位置。
- 新方法(DreamControl-v2):我们直接给这个司机发了一本卡车驾驶手册,里面全是卡车怎么开、怎么转弯、怎么换挡的详细教程。他看完后,直接就能熟练地驾驶卡车,不需要再试错,也不需要别人在旁边指挥。
一句话总结:
DreamControl-v2 通过把人类动作提前“翻译”成机器人语言,并训练一个专为机器人设计的动作生成大脑,让人形机器人能更简单、更快速地学会各种高难度的干活技能,真正走向了自主化。
DreamControl-v2:基于可训练引导扩散先验的简单可扩展自主人形机器人技能学习
1. 研究背景与问题 (Problem)
人形机器人的自主 loco-manipulation(移动与操作)技能开发仍是一个开放性问题。虽然强化学习(RL)在腿式运动中取得了成功,但在涉及长时程规划和复杂交互的操作任务中应用 RL 仍面临巨大挑战。
现有的 DreamControl 框架提出了一种两阶段方案:利用现成的人类运动扩散模型(如 OmniControl)生成“梦境”轨迹,然后训练 RL 策略去跟踪这些轨迹。然而,DreamControl 存在显著的可扩展性和通用性瓶颈:
- 空间不匹配与试错调整:DreamControl 采用“生成后重定向”(generate-then-retarget)流程。它在人类动作空间生成轨迹,然后重定向到机器人(如 Unitree G1)。由于重定向会改变末端执行器的位置,原本在人类空间满足的空间约束(如手到达某点)在机器人空间会失效。这导致需要人工通过试错(trial-and-error)调整输入提示(prompt),过程繁琐且难以扩展。
- 数据局限性:现有模型主要基于 AMASS 等人类动作捕捉数据集,缺乏机器人特有的复杂交互数据(如开门、抓取特定物体),导致生成的动作对某些机器人任务不适用。
- 人工干预:需要大量手动过滤生成的轨迹,并针对特定任务使用逆运动学(IK)等补丁,限制了自动化程度。
2. 方法论 (Methodology)
DreamControl-v2 提出了一种直接在机器人动作空间训练引导扩散模型的新框架,通过“预重定向”(pre-retargeting)策略解决了上述问题。其核心流程分为四个阶段(如图 2 所示):
A. 大规模人类数据到机器人空间的转换 (Massive Human Data to Robot-Space)
- 数据构建:收集并整合了多样化的人类运动数据集(AMASS, HumanML3D, GRAB, Nymeria)以及机器人操作数据(OmniRetarget)。
- 统一重定向:在训练扩散模型之前,先将所有人类运动数据重定向到目标机器人(Unitree G1)的运动学空间。
- 定义人类与机器人共享的 12 个关键点(髋、膝、踝、肩、肘、腕等)。
- 通过优化算法最小化相对关节角、关键点位置差异及足部滑动,同时补偿肢体长度差异,生成机器人空间的关节角和全局位姿。
- 处理不同数据源(如 SMPL 模型与 Xsens 骨架)的格式不匹配问题,统一转换为 SMPL 参数表示。
- 自动化过滤:应用基于可行性的过滤器(如 PHC 标准)去除不可行的动作(如 treadmill 跑步),并利用关键词检索提取特定任务片段(如“打开抽屉”)。
B. 扩散先验训练 (Diffusion Prior Training)
- 模型架构:基于 OmniControl 架构(初始化自 MDM 权重),在机器人空间数据上训练。
- 条件生成:模型接受开放词汇文本指令(Text)和时空控制信号(Spatio-temporal Control Signals, c)作为条件。
- 控制信号 c 指定特定关节在特定时间点的 3D 目标位置(例如:右手腕在 tj 时刻到达抽屉把手位置)。
- 未受约束的关节设为零。
- 采样与后处理:
- 利用空间引导(Spatial Guidance)和 CFG 采样满足空间约束。
- 生成轨迹后,通过后优化模块转换为可执行的机器人关节角度,并应用自动化过滤(如检查足部稳定性、根节点高度、障碍物避免等)确保物理合理性。
C. 基于物理的运动模仿强化学习 (RL for Physics-Based Motion Imitation)
- 利用扩散模型生成的参考轨迹作为目标,训练 RL 策略。
- 奖励函数:包含任务完成奖励(如成功打开抽屉)和轨迹跟踪奖励。
- Sim2Real:策略在仿真中训练,直接部署到真实 Unitree G1 机器人上,无需在推理时提供参考轨迹,实现完全自主执行。
3. 关键贡献 (Key Contributions)
- 原生机器人空间扩散先验:首次提出在机器人动作空间直接训练引导扩散模型,消除了“生成 - 重定向”流程中的空间约束丢失问题,无需人工试错调整提示。
- 可扩展的数据混合策略:通过整合多源异构数据(人类 Mocap + 机器人操作数据),显著扩大了技能覆盖范围,使模型能够处理 AMASS 中未包含的复杂交互任务(如开门、深蹲抓取)。
- 全自动化流水线:移除了对特定任务逆运动学(IK)和人工轨迹过滤的依赖,建立了一个从数据准备到 RL 部署的端到端自动化流程。
- 规模效应验证:证明了增加扩散模型的训练数据量和采样轨迹数量,能显著提升下游 RL 策略的成功率和鲁棒性。
4. 实验结果 (Results)
实验在仿真环境和真实的 Unitree G1 机器人上进行,涵盖了 8 种技能(如开门、深蹲抓取、拳击、倾倒等)。
- 扩散模型质量:
- FID (Fréchet Inception Distance):Full-Mix 模型(混合所有数据)的 FID 最低(0.265),显著优于仅使用 AMASS 的模型和零样本 OmniControl 基线,表明生成轨迹质量更高。
- R-Precision & Diversity:在文本 - 动作对齐度和动作多样性上均有提升。
- 控制精度 (Control L2):Full-Mix 模型的控制误差显著降低(0.066),表明生成的轨迹能更精准地满足时空约束。
- 下游 RL 性能:
- 任务成功率:在复杂的 Group-1 任务(如开门、深蹲抓取)中,DreamControl-v2 的成功率远高于基线(Zero-Shot OmniControl 和仅 AMASS 训练模型)。例如,开门任务成功率从低水平提升至 96%。
- 数据规模效应:随着采样轨迹数量的增加,RL 策略的成功率持续上升并趋于饱和(图 3)。
- 对比分析:
- 预重定向 vs. 推理时提示校准:传统的“试错提示校准”方法样本效率极低(有效轨迹率仅 4-8%),且导致轨迹不稳定;而 DreamControl-v2 的预重定向方法有效轨迹率高达 68%,且无需人工干预。
- 网络初始化:使用预训练权重(MDM)微调比从头训练收敛更快且性能更好。
5. 意义与影响 (Significance)
DreamControl-v2 为人形机器人技能学习提供了一条更简单、更可扩展的路径:
- 解决核心痛点:通过“预重定向”策略,从根本上解决了人类动作生成模型与机器人本体之间的空间映射失配问题,消除了繁琐的人工调参。
- 推动自主化:证明了利用大规模混合数据训练原生机器人扩散先验,可以生成高质量、物理合理的参考轨迹,从而训练出能够自主完成复杂交互任务的 RL 策略。
- 通用性潜力:该框架不依赖特定任务的手工设计,能够适应多种 loco-manipulation 任务,为构建通用型人形机器人奠定了重要的技术基础。
简而言之,DreamControl-v2 通过将扩散模型从“人类空间”迁移到“机器人空间”,并引入大规模数据混合,实现了人形机器人技能获取的自动化和规模化突破。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。