← 最新论文
💻 computer science

Humanoid-DART: Humanoid Loco-Manipulation using Diffusion-guided Augmentation through Relabeling and Tracking

Humanoid-DART 是一个结合了基于扩散模型的轨迹生成与强化学习的自监督框架,旨在通过自动探索目标空间并以极少的专家监督,使类人机器人能够从稀疏的演示中学习多样化的全身运动控制(loco-manipulation)技能。

原作者: Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个人形机器人完成复杂的家务,比如拿起一个箱子并将其移动到特定位置,或者踢一个球。通常情况下,要教会机器人这些任务,你需要记录数百小时人类完美完成这些任务的过程。但这既昂贵又缓慢,而且很难涵盖每一种可能的变化(例如:如果箱子变重了呢?如果目标点变远了呢?)。

这篇论文介绍了一个名为 Humanoid-DART 的巧妙系统,它能让机器人仅通过极少数的示例(少至四个)就掌握这些任务。它的工作原理就像一位富有创造力的教练,不仅是重复所见,还会构思新的实现方式,并不断练习直到成功。

以下是该系统的运作方式,分为几个简单的部分:

1. 双队策略

与其试图在一个巨大的大脑中教给机器人一切,Humanoid-DART 将工作拆分为两个相互协作的专业团队:

  • “梦想家”(扩散模型/The Dreamer): 这是一个富有创造力的规划者。它的任务是为机器人构思一条可以遵循的路径。它观察现有的少量示例,并开始“梦见”到达新目标时略有不同的新路径。你可以把它想象成一位艺术家在地图上勾勒出新的路线。起初,这些草图在物理上可能是不可能实现的(比如穿墙而过或在地上滑动),但它们在探索机器人“可以去哪里”方面表现出色。
  • “运动员”(强化学习策略/The Athlete): 这是一个物理执行者。它的任务是接收“梦想家”的草图,并在机器人身上实际尝试运行。它扮演着严厉教练的角色。如果“梦想家”勾勒出的路径导致机器人的脚滑动或摔倒,那么“运动员”就会说:“不行,这行不通,”并修正动作以使其符合物理规律。

2. “练习循环”(课程学习/The Practice Loop)

其魔力在于这两个团队如何随着时间的推移进行交流。系统按周期运行,就像训练营一样:

  1. 选择目标: 系统选择一个目标(例如:“将箱子移动到这个新位置”)。
  2. 做梦: “梦想家”创建一个到达那里的粗略计划。
  3. 测试: “运动员”在物理模拟器中尝试执行该计划。
  4. 过滤与重新标注:
    • 如果机器人摔倒或失败,该计划会被丢弃。
    • 秘诀所在: 如果机器人“差一点就成功了”(即“险些达成”),系统不会将其视为失败。相反,它会说:“好吧,你虽然没有达到预定的目标点,但你成功到达了这个位置。” 它会将这次尝试重新标注为对该实际到达位置的成功。
  5. 学习: “梦想家”从这些成功的(或接近成功的)尝试中学习,从而变得更擅长为这些特定位置构思计划。“运动员”也变得更擅长执行这些计划。
  6. 重复: 系统根据刚刚学到的内容选择新的、难度稍大的目标,像滚雪球一样扩展其技能。

3. “双脑”架构

为了让“梦想家”在处理行走和持物时都表现出色,论文赋予了它一个特殊的两部分大脑结构:

  • 导航器(The Navigator): 关注大局(机器人的脚要去哪里)。
  • 定位器(The Localizer): 关注细节(手部和关节相对于物体的运动方式)。
    通过这种分离,机器人学会了协调全身,而不会产生混乱,确保当它走向箱子时,它的手已经准备好抓取物体。

4. 结果

研究人员在真实机器人(Unitree G1)和模拟器中测试了该系统。他们仅从四个基础示例开始,涉及推、踢、递交或拿起箱子等任务。

  • 结果: 该系统不仅仅是复制那四个示例。它学会了针对比原始示例远 4 到 5 倍的目标执行任务。
  • 覆盖范围: 对于“拿起并放置”的任务,机器人学会了覆盖 96% 的可能目标区域,而其他方法只能覆盖极小的一部分。

总结

Humanoid-DART 就像一名学生,虽然从几本教科书案例开始学习,但通过以下方式解决了成千上万个新问题:

  1. 构思新的解决方案。
  2. 尝试它们并观察哪些真正有效。
  3. 将“差一点就成功”视为新的学习机会。
  4. 在不需要人类记录每一种变化的情况下,慢慢构建一个庞大的技能库。

论文结论指出,这种方法允许机器人从稀疏的数据中学习复杂的全身任务,使得教导机器人的过程比以往任何时候都更快、更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →