想象一下教一个机器人成为跑酷运动员。目标不仅仅是让它行走,而是要让它像人类一样流畅地奔跑、跳跃、翻越墙壁并攀爬障碍物。这篇题为《感知型人形跑酷》的论文,描述了一种新方法,用于训练宇树 G1 机器人(一种人形机器)实现上述能力。
以下是他们如何实现这一目标的完整故事,将其拆解为简单的概念和类比。
1. 问题:机器人的“失忆症”
此前,机器人擅长在平坦地面或简单楼梯上行走。但跑酷是混乱的。它需要将不同的动作串联起来:奔跑,然后跳跃,接着抓住墙壁,再拉身向上,最后翻滚落地。
问题在于,机器人通常一次只学习一个技巧。如果你教机器人跳跃,它并不知道如何从奔跑平滑过渡到跳跃。这就像教钢琴家完美地弹奏单个音符,然后却要求他们演奏整首曲子,而他们却不知道如何将手指从一个音符移动到下一个音符。此外,机器人难以“看清”障碍物并决定使用哪种动作(例如:“我应该跨过这个小箱子,还是爬上那堵高墙?”)。
2. 解决方案:“动作匹配”播放列表
为了解决“过渡”问题,研究人员使用了一种称为**动作匹配(Motion Matching)**的技术。
- 类比:想象一位 DJ 拥有一个包含人类跑酷动作(奔跑、翻越、攀爬)的庞大播放列表。DJ 不是试图从头创作一首新歌,而是观察机器人此刻正在做什么,并立即在播放列表中找到完美契合的下一个片段。
- 工作原理:系统观察机器人当前的速度和位置。它在人类动作数据库中搜索,找到人类从奔跑自然过渡到翻越墙壁的确切帧。系统将这些片段拼接在一起,生成一段长长的、流畅的“参考电影”,展示机器人应该做什么。
- 结果:这创造了一个“长视野”计划。机器人不仅仅思考下一步,而是思考整个奔跑过程,确保从冲刺到爬墙的过渡看起来自然流畅。
3. 训练:“师生”健身房
一旦有了“参考电影”,就需要教机器人的大脑(其策略)如何仅凭眼睛(深度相机)和身体传感器来实际执行这些动作。
- 老师(专家):首先,他们在超快的计算机模拟中训练“老师”机器人。这些老师拥有“超能力”(特权信息),例如确切知道自己在世界中的位置以及地面的完美物理特性。他们学会了完美地跟踪参考电影。
- 学生(真实机器人):真实机器人没有超能力。它只有相机和自身的身体传感器。为了教导学生,研究人员采用了两步流程:
- 模仿(DAgger):学生尝试模仿老师的动作。
- 强化学习(教练):这是秘诀所在。单纯的模仿是不够的,因为跑酷动作(如高跳)需要突然而强大的能量爆发。如果学生只是模仿老师的平均动作,其力量可能不足以翻越墙壁。因此,他们加入了一位“教练”(RL),它会说:“你翻过墙了吗?如果是,很好!如果不是,再努力点。”这促使学生去学习单纯模仿所遗漏的必要能量爆发。
4. 结果:机器人成为跑酷专家
研究人员在现实世界中对真实的宇树 G1 机器人进行了测试。以下是它取得的成就:
- 速度:它可以在约3 米/秒(约 6.7 英里/小时)的速度下奔跑并翻越障碍物。
- 高度:它可以攀爬1.25 米高的墙壁(相当于机器人自身高度的 96%)。为了便于理解,如果一个人类身高 6 英尺,那么这个机器人正在攀爬一堵 6 英尺高的墙。
- 适应性:机器人可以应对包含多个障碍物的复杂赛道。如果你在机器人奔跑时移动障碍物,它会看到变化,重新计算,并即时调整跳跃或攀爬动作,而不会摔倒。
- 零样本迁移:机器人完全在计算机模拟中学习,然后直接进入现实世界,无需重新学习任何内容。
魔法总结
该论文声称,通过结合动作匹配(用于创建平滑的长计划)与师生训练流程(用于学习执行这些计划所需的物理力量),他们创造出了能够自主导航复杂、充满障碍环境的机器人。
这不仅仅是行走;它是奔跑、翻越、攀爬和翻滚,展现出此前人形机器人无法独自达到的敏捷水平。机器人本质上学会了“阅读”环境,并实时“编排”自己的跑酷路线。
技术摘要:感知型人形跑酷(PHP)
问题陈述
尽管近期进展已使人形机器人能够在多变地形上实现稳定行走,但复现高度动态人类动作的敏捷性、适应性和表现力仍然是一项重大挑战。具体而言,在复杂环境中执行跑酷需要:
- 底层鲁棒性:在极短时间内控制高维动作空间以完成富含接触的动作(如攀爬墙壁、翻越障碍)。
- 感知驱动的决策:将外感知(视觉)与控制紧密耦合,以适应环境变化和意外扰动。
- 长视野技能组合:将多种高度动态的技能整合为单一的视觉运动策略,使其能够在复杂障碍赛道中实现无缝过渡。
主要瓶颈在于高度动态人类运动数据的稀缺。捕捉快速且富含接触的动作通常会产生稀疏数据集(每种技能往往仅有一两次演示),这不足以学习需要丰富变化(如接近距离、时机以及不同技能间平滑过渡)的长视野任务。
方法论
作者提出了感知型人形跑酷(PHP),这是一个模块化框架,整合了人类运动先验、长视野技能组合和感知控制。该流程包含三个主要阶段:
1. 基于运动匹配的自适应技能组合
为解决数据稀缺及多样化过渡的需求,作者采用运动匹配作为离线合成模块。
- 原子技能:利用OmniRetarget将人类运动数据重定向至机器人(Unitree G1),构建原子跑酷技能库(如翻越、攀爬)。
- 组合:系统并非手工构建每对技能间的过渡,而是通过“运动→技能→运动”结构,将运动片段与原子技能串联,组合成长视野运动学轨迹。
- 机制:运动匹配在特征空间(包含未来轨迹、脚部位置和根速度)中执行最近邻搜索,以拼接运动片段。这种机制“稠密化”了稀疏的运动库,生成了跨越不同接近距离、朝向和时机的多样化过渡。
- 随机化:在合成轨迹周围对障碍物几何形状和姿态进行随机化,使策略暴露于各种变化中,同时不破坏底层参考运动的有效性。
2. 教师 - 学生训练流程
该框架利用两阶段训练过程,将技能从仿真迁移至现实:
- 教师训练(特权强化学习):在仿真中使用带有运动跟踪奖励的强化学习(RL)训练单技能专家策略。这些专家接收特权观测(如全局骨盆位置/速度),以学习恢复行为并纠正漂移,这对于误差会迅速累积的富含接触任务至关重要。
- 学生蒸馏(DAgger + RL):从多个教师中蒸馏出一个基于深度的单一学生策略。作者认为,纯模仿学习(DAgger)不足以应对高度动态技能,因为它未明确偏向成功所需的大幅度扭矩爆发(例如攀爬中的“引体向上”阶段)。
- 混合目标:学生使用组合损失函数进行训练:L=λPPOLPPO+λDLD。
- RL 的作用:PPO 组件提供以成功为导向的信号,鼓励利用清除障碍所需的高扭矩动作,而 DAgger 提供正则化以防止不自然的行为。
- 课程学习:预热课程逐渐将权重从 DAgger 转移至 PPO,以稳定训练过程。
3. 零样本仿真到现实迁移
学生策略使用机载深度传感(通过 Nvidia WARP 模拟)和本体感觉进行训练。它仅接收离散的二维速度指令和深度图像,从而能够在推理过程中自主选择并执行技能(踏步、攀爬、翻越、翻滚),而无需显式的技能标签。
主要贡献
- 高效的运动学技能组合:通过运动匹配将重定向的人类运动串联成多样化的长视野轨迹,克服了动态运动数据稀缺的问题。
- 可扩展的训练框架:采用教师 - 学生架构,将多个特权专家蒸馏为单一的基于深度的策略,利用混合的 DAgger 和 RL 目标来处理动态技能所需的高扭矩要求。
- 成功的零样本仿真到现实迁移:在物理 Unitree G1 机器人上展示了高度动态的跑酷,包括攀爬高达 1.25 米(机器人身高的 96%)的墙壁,以及在闭环适应下穿越复杂的多障碍赛道。
实验结果
该框架在仿真和现实世界中均于 Unitree G1 人形机器人(高 1.3 米,29 个自由度)上进行了验证。
- 人类级敏捷性:机器人成功在 3.63 秒内攀爬了 1.25 米高的墙壁,其速度与执行相同动作的人类跑酷者相当。它还在高达 3.41 米/秒的速度下执行了跨越 0.4 米障碍物的猫式翻越,并完成了从 1.25 米高度的跌落着陆。
- 长视野穿越:机器人自主穿越了长达 60 秒的连续跑酷赛道,涉及多个障碍物和技能过渡(踏步、攀爬、翻越),且在训练期间未接受显式的多障碍物监督。
- 适应性:系统展示了对实时障碍物扰动(约 0.5 米的随机位移)的闭环适应能力,调整接近时机和动作选择以完成穿越。
- 消融研究:
- 运动匹配密度:对接近距离的高密度覆盖至关重要;稀疏数据(例如仅包含极端距离)会导致中间场景失败。
- 蒸馏中的 RL:移除 RL 组件(仅使用 DAgger)会导致性能显著下降,特别是在高障碍物上,机器人无法产生引体向上阶段所需必要的扭矩爆发。
- 基线对比:所提出的方法显著优于使用纯奖励塑形(速度跟踪)、未组合的运动数据以及无蒸馏的端到端深度训练的基线方法。
意义与主张
论文声称,PHP 代表了现实世界中敏捷、自适应、全身跑酷的最先进方法。其意义在于:
- 弥合差距:成功将高度动态、富含接触的人类技能迁移至人形机器人,而以往的工作主要局限于较低动态的任务,如爬楼梯或在稀疏地形上行走。
- 数据效率:证明了运动匹配可以有效地从稀疏的人类数据中合成长视野参考,从而无需海量数据集即可学习复杂的技能链。
- 鲁棒性:证明了单一的视觉运动策略可以基于机载感知自主选择并在多样化技能间过渡,能够处理静态和动态的环境变化。
作者指出了局限性,包括目前缺乏语义场景理解(仅依赖几何深度)以及硬件限制(手部力量有限,难以应对极端攀爬或悬挂动作)。他们建议未来的工作可以纳入更丰富的条件信号(如语言)和改进的传感技术,以减少高速运动下的感知歧义。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。