想象一下,你正在教一个人形机器人完成复杂的家务,比如拿起一个箱子并将其移动到特定位置,或者踢一个球。通常情况下,要教会机器人这些任务,你需要记录数百小时人类完美完成这些任务的过程。但这既昂贵又缓慢,而且很难涵盖每一种可能的变化(例如:如果箱子变重了呢?如果目标点变远了呢?)。
这篇论文介绍了一个名为 Humanoid-DART 的巧妙系统,它能让机器人仅通过极少数的示例(少至四个)就掌握这些任务。它的工作原理就像一位富有创造力的教练,不仅是重复所见,还会构思新的实现方式,并不断练习直到成功。
以下是该系统的运作方式,分为几个简单的部分:
1. 双队策略
与其试图在一个巨大的大脑中教给机器人一切,Humanoid-DART 将工作拆分为两个相互协作的专业团队:
- “梦想家”(扩散模型/The Dreamer): 这是一个富有创造力的规划者。它的任务是为机器人构思一条可以遵循的路径。它观察现有的少量示例,并开始“梦见”到达新目标时略有不同的新路径。你可以把它想象成一位艺术家在地图上勾勒出新的路线。起初,这些草图在物理上可能是不可能实现的(比如穿墙而过或在地上滑动),但它们在探索机器人“可以去哪里”方面表现出色。
- “运动员”(强化学习策略/The Athlete): 这是一个物理执行者。它的任务是接收“梦想家”的草图,并在机器人身上实际尝试运行。它扮演着严厉教练的角色。如果“梦想家”勾勒出的路径导致机器人的脚滑动或摔倒,那么“运动员”就会说:“不行,这行不通,”并修正动作以使其符合物理规律。
2. “练习循环”(课程学习/The Practice Loop)
其魔力在于这两个团队如何随着时间的推移进行交流。系统按周期运行,就像训练营一样:
- 选择目标: 系统选择一个目标(例如:“将箱子移动到这个新位置”)。
- 做梦: “梦想家”创建一个到达那里的粗略计划。
- 测试: “运动员”在物理模拟器中尝试执行该计划。
- 过滤与重新标注:
- 如果机器人摔倒或失败,该计划会被丢弃。
- 秘诀所在: 如果机器人“差一点就成功了”(即“险些达成”),系统不会将其视为失败。相反,它会说:“好吧,你虽然没有达到预定的目标点,但你成功到达了这个位置。” 它会将这次尝试重新标注为对该实际到达位置的成功。
- 学习: “梦想家”从这些成功的(或接近成功的)尝试中学习,从而变得更擅长为这些特定位置构思计划。“运动员”也变得更擅长执行这些计划。
- 重复: 系统根据刚刚学到的内容选择新的、难度稍大的目标,像滚雪球一样扩展其技能。
3. “双脑”架构
为了让“梦想家”在处理行走和持物时都表现出色,论文赋予了它一个特殊的两部分大脑结构:
- 导航器(The Navigator): 关注大局(机器人的脚要去哪里)。
- 定位器(The Localizer): 关注细节(手部和关节相对于物体的运动方式)。
通过这种分离,机器人学会了协调全身,而不会产生混乱,确保当它走向箱子时,它的手已经准备好抓取物体。
4. 结果
研究人员在真实机器人(Unitree G1)和模拟器中测试了该系统。他们仅从四个基础示例开始,涉及推、踢、递交或拿起箱子等任务。
- 结果: 该系统不仅仅是复制那四个示例。它学会了针对比原始示例远 4 到 5 倍的目标执行任务。
- 覆盖范围: 对于“拿起并放置”的任务,机器人学会了覆盖 96% 的可能目标区域,而其他方法只能覆盖极小的一部分。
总结
Humanoid-DART 就像一名学生,虽然从几本教科书案例开始学习,但通过以下方式解决了成千上万个新问题:
- 构思新的解决方案。
- 尝试它们并观察哪些真正有效。
- 将“差一点就成功”视为新的学习机会。
- 在不需要人类记录每一种变化的情况下,慢慢构建一个庞大的技能库。
论文结论指出,这种方法允许机器人从稀疏的数据中学习复杂的全身任务,使得教导机器人的过程比以往任何时候都更快、更高效。
技术摘要:Humanoid-DART
问题陈述
人形机器人的运动操纵(loco-manipulation)需要协调全身控制与动态物体交互。虽然模仿学习和强化学习(RL)的最新进展通过追踪专家演示实现了令人印象深刻的运动技能,但将这些方法扩展到富含接触的任务型运动操纵仍是一个重大挑战。与单纯的运动不同,运动操纵涉及一个由身体运动、物体状态和环境交互共同定义的庞大且连续的任务空间。物体姿态、运输配置、抓取策略以及交互时机的变化产生了一个组合空间,仅靠人类演示是无法以极高的成本覆盖该空间的。现有方法通常依赖大规模的人类运动数据集,或侧重于追踪单一的参考行为,无法在多变条件下稳健地解决多样化的运动操ло操纵任务。
方法论
本文提出了 Humanoid-DART,这是一个自监督、迭代式的框架,旨在从稀疏的初始演示中进行引导,并逐步扩展其行为谱系。该流水线在两个紧密耦合的组件之间交替运行:一个目标条件运动生成器和一个基于物理的运动追踪策略。
1. 算法概述
该系统作为一个进化课程运行,其技能分布由成功轨迹的精英存档 E 定义。
- 目标采样: 在每次迭代中,课程会在当前 E 中的分布周围采样新的目标状态,旨在既精炼现有技能,又探索代表性不足的区域。
- 运动学生成: 一个目标条件扩散模型 (πθ) 为采样的目标生成运动学参考轨迹。这些轨迹可能包含物理不一致性(例如足部滑动、穿透)。
- 物理评估: 一个通过强化学习训练的运动追踪策略 (πϕ) 在物理模拟器中执行这些运动学参考。它作为一个动态滤波器,将潜在不可行的规划转化为物理一致的展开过程(rollouts)。
- 选择与重标记: 生成的轨迹使用适应度函数 F(τ) 进行评估,该函数衡量追踪保真度、接触正确性和稳定性。超过阈值 τf 的轨迹会被保留在精英存档 E 中。至关重要的是,那些未能完美匹配采样目标的成功展开过程会被重标记为它们实际达到的任务指标,从而将“差一点就成功”的过程转化为有效的训练信号。
- 迭代更新: 扩散生成器和追踪策略都会在扩展后的存档上进行重新训练,从而逐步增加可行轨迹的多样性和任务空间覆盖率。
2. 核心架构组件
- 运动学运动生成器(扩散 Transformer):
- 双支路主干网络: 该架构将状态分为全局流(根部运动和物体相对特征)和局部流(身体姿态/关节)。局部流对全局流进行交叉注意力计算,将粗略导航与精细姿态合成解耦,同时保持同步。
- 结构化部分掩码(Structured Partial Unmasking): 在训练期间,模型选择性地揭示来自未来帧的带噪特征组。这鼓励规划器从部分观测中推断缺失的运动组件,学习特征组之间的相关性(例如,全身姿态与物体交互之间的关系),而不是将其视为独立个体。
- 推理: 使用基于重叠段的自回归合成结合历史补全(RePaint 风格),以确保时间一致性。
- 运动追踪策略:
- 一个受 DeepMimic 启发、通过近端策略优化(PPO)训练的非对称 Actor-Critic 控制器。
- 它观察 5 步参考时界、本体感受状态和物体姿态,其中 Critic 接收特权模拟状态。
- 训练结合了领域随机化(物体质量、摩擦力、推力),以确保从仿真到现实(sim-to-real)的迁移。
- 课程与目标重标记:
- 前沿目标采样: 任务空间被离散化为若干分箱(bins)。根据分箱距离当前精英集的距离分配采样权重:精炼(靠近现有精英)、探索(中等距离)以及前沿(远离、未解决的区域)。探索分箱被赋予最高权重,以驱动覆盖范围的扩张。
- 目标重标记: 系统不会丢弃那些未能达到采样目标的展开过程,而是追溯性地将达到的状态视为预期的目标,从而即使在生成器训练不足的情况下也能提供密集的学习信号。
核心贡献
- Humanoid-DART 流水线: 首个用于从稀疏演示中学习目标条件运动操纵技能的迭代式轨迹增强流水线。
- 新颖的设计选择:
- 一个具有双支路架构和结构化部分掩码的层次化目标条件扩散 Transformer (DiT),用以提升在稀疏数据环境下的轨迹合成能力。
- 一个以物体姿态为条件的强化学习全身控制器,用于追踪生成的轨迹。
- 一个带有目标重标记策略的基于课程的算法,该策略能将接近成功的展开过程转化为有效的训练信号。
- 实验验证: 在使用 Unitree G1 人形机器人的四项运动操纵任务(推、踢、递接、取放)上验证了该框架。系统仅需极少的初始演示即可实现任务空间覆盖,并展现出强大的泛化能力。
实验结果
- 任务空间覆盖率: 在取放任务中,Humanoid-DART 仅从四个基础演示(约 20 秒运动)开始,就实现了 96.4% 的目标任务空间覆盖。这代表了从 0.1% 到接近完全覆盖的增长过程,历经四个世代。
- 泛化能力: 系统成功生成并追踪了比基础演示目标远 4–5 倍 的轨迹,展示了强大的泛化性能。
- 现实世界部署: 生成的轨迹已成功部署在物理 Unitree G1 人形机器人上执行推、踢和取放任务,证实了其在硬件上的动态可行性。
- 消融实验:
- 架构: 去除双支路结构(退化为单一扁平 DiT)会导致目标达成成功率从 1.00 降至 0.25。结构化部分掩码提高了路径的笔直度和抓取的一致性。
- 基准测试: 与“参数化运动”(侧重于窄域高质量区域)和“层次化扩散 + RL”(在没有进化循环的情况下进行联合训练)相比,Humanoid-DART 展示了更优越的任务空间覆盖率。进化循环被确定为性能提升的主要驱动力。
- 初始化: 与运动学可行(KF)种子相比,动态可行(DF)种子轨迹能带来更快的收敛速度和更高的覆盖率,因为 KF 种子往往包含物理不一致性,而扩散模型会放大这些不一致性。
意义与主张
本文声称 Humanoid-DART 通过利用生成模型迭代扩展轨迹参考集,解决了人形运动操纵中数据匮乏的瓶颈。通过将高层运动生成与底层控制解耦,并利用带有目标重标记的课程学习,该框架能够以极少的人类监督学习到鲁棒的目标条件策略。作者强调,这种方法能够发现超越初始种子演示范围的多样化行为和长时程技能,为无需大规模人类运动数据集的通用人形机器人操作提供了一条可扩展的路径。
局限性与未来工作: 目前的评估仅限于单一物体几何形状和平坦地形。作者指出,该流水线继承了种子演示的偏差,并依赖于人工调优的适应度函数。未来的工作旨在将该框架扩展到多样化的物体、接触属性和不平整地形,并将适应度函数替换为自适应的学习准则。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。