← 最新论文
⚡ electrical engineering

Perceptive Humanoid Parkour: Chaining Dynamic Human Skills via Motion Matching

本文提出了感知型人形跑酷(PHP),这是一个模块化框架,它结合了用于技能组合的运动匹配与感知驱动的强化学习,使人形机器人能够在真实环境中动态适应并自主执行复杂、长程的跑酷任务。

原作者: Zhen Wu, Xiaoyu Huang, Lujie Yang, Yuanhang Zhang, Xi Chen, Pieter Abbeel, Rocky Duan, Angjoo Kanazawa, Carmelo Sferrazza, Guanya Shi, C. Karen Liu

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhen Wu, Xiaoyu Huang, Lujie Yang, Yuanhang Zhang, Xi Chen, Pieter Abbeel, Rocky Duan, Angjoo Kanazawa, Carmelo Sferrazza, Guanya Shi, C. Karen Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下教一个机器人成为跑酷运动员。目标不仅仅是让它行走,而是要让它像人类一样流畅地奔跑、跳跃、翻越墙壁并攀爬障碍物。这篇题为《感知型人形跑酷》的论文,描述了一种新方法,用于训练宇树 G1 机器人(一种人形机器)实现上述能力。

以下是他们如何实现这一目标的完整故事,将其拆解为简单的概念和类比。

1. 问题:机器人的“失忆症”

此前,机器人擅长在平坦地面或简单楼梯上行走。但跑酷是混乱的。它需要将不同的动作串联起来:奔跑,然后跳跃,接着抓住墙壁,再拉身向上,最后翻滚落地。

问题在于,机器人通常一次只学习一个技巧。如果你教机器人跳跃,它并不知道如何从奔跑平滑过渡到跳跃。这就像教钢琴家完美地弹奏单个音符,然后却要求他们演奏整首曲子,而他们却不知道如何将手指从一个音符移动到下一个音符。此外,机器人难以“看清”障碍物并决定使用哪种动作(例如:“我应该跨过这个小箱子,还是爬上那堵高墙?”)。

2. 解决方案:“动作匹配”播放列表

为了解决“过渡”问题,研究人员使用了一种称为**动作匹配(Motion Matching)**的技术。

  • 类比:想象一位 DJ 拥有一个包含人类跑酷动作(奔跑、翻越、攀爬)的庞大播放列表。DJ 不是试图从头创作一首新歌,而是观察机器人此刻正在做什么,并立即在播放列表中找到完美契合的下一个片段。
  • 工作原理:系统观察机器人当前的速度和位置。它在人类动作数据库中搜索,找到人类从奔跑自然过渡到翻越墙壁的确切帧。系统将这些片段拼接在一起,生成一段长长的、流畅的“参考电影”,展示机器人应该做什么。
  • 结果:这创造了一个“长视野”计划。机器人不仅仅思考下一步,而是思考整个奔跑过程,确保从冲刺到爬墙的过渡看起来自然流畅。

3. 训练:“师生”健身房

一旦有了“参考电影”,就需要教机器人的大脑(其策略)如何仅凭眼睛(深度相机)和身体传感器来实际执行这些动作。

  • 老师(专家):首先,他们在超快的计算机模拟中训练“老师”机器人。这些老师拥有“超能力”(特权信息),例如确切知道自己在世界中的位置以及地面的完美物理特性。他们学会了完美地跟踪参考电影。
  • 学生(真实机器人):真实机器人没有超能力。它只有相机和自身的身体传感器。为了教导学生,研究人员采用了两步流程:
    1. 模仿(DAgger):学生尝试模仿老师的动作。
    2. 强化学习(教练):这是秘诀所在。单纯的模仿是不够的,因为跑酷动作(如高跳)需要突然而强大的能量爆发。如果学生只是模仿老师的平均动作,其力量可能不足以翻越墙壁。因此,他们加入了一位“教练”(RL),它会说:“你翻过墙了吗?如果是,很好!如果不是,再努力点。”这促使学生去学习单纯模仿所遗漏的必要能量爆发。

4. 结果:机器人成为跑酷专家

研究人员在现实世界中对真实的宇树 G1 机器人进行了测试。以下是它取得的成就:

  • 速度:它可以在约3 米/秒(约 6.7 英里/小时)的速度下奔跑并翻越障碍物。
  • 高度:它可以攀爬1.25 米高的墙壁(相当于机器人自身高度的 96%)。为了便于理解,如果一个人类身高 6 英尺,那么这个机器人正在攀爬一堵 6 英尺高的墙。
  • 适应性:机器人可以应对包含多个障碍物的复杂赛道。如果你在机器人奔跑时移动障碍物,它会看到变化,重新计算,并即时调整跳跃或攀爬动作,而不会摔倒。
  • 零样本迁移:机器人完全在计算机模拟中学习,然后直接进入现实世界,无需重新学习任何内容。

魔法总结

该论文声称,通过结合动作匹配(用于创建平滑的长计划)与师生训练流程(用于学习执行这些计划所需的物理力量),他们创造出了能够自主导航复杂、充满障碍环境的机器人。

这不仅仅是行走;它是奔跑、翻越、攀爬和翻滚,展现出此前人形机器人无法独自达到的敏捷水平。机器人本质上学会了“阅读”环境,并实时“编排”自己的跑酷路线。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →