← 最新论文
💻 computer science

Chasing Autonomy: Dynamic Retargeting and Control Guided RL for Performant and Controllable Humanoid Running

该论文提出了一种结合动态运动重定向与目标导向控制引导强化学习的框架,成功在 Unitree G1 人形机器人上实现了最高 3.3 m/s 的奔跑速度、长距离自主续航以及户外动态避障能力。

原作者: Zachary Olkin, William D. Compton, Ryan M. Bena, Aaron D. Ames

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Zachary Olkin, William D. Compton, Ryan M. Bena, Aaron D. Ames

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个让机器人像人类一样奔跑,并且能听指挥、避障碍的突破性方法。

想象一下,你教一个刚学会走路的机器人去跑步。以前的方法要么让它像机器人一样僵硬地跑,要么让它模仿人类动作但跑不远、跑不快,甚至一遇到障碍物就摔倒。

这篇论文的作者(来自加州理工学院)提出了一套全新的“训练秘籍”,让 Unitree G1 这款机器人不仅能跑出3.3 米/秒(相当于人类慢跑甚至快跑的速度),还能在户外跑几百米,甚至一边跑一边灵活地躲避障碍物。

我们可以把整个过程比作**“培养一名奥运短跑运动员”**,分为三个关键步骤:

第一步:从“照猫画虎”到“量身定做” (动态重定向)

  • 以前的做法(照猫画虎): 研究人员直接拿人类跑步的视频数据,强行套用到机器人身上。这就像给一个身材比例完全不同的机器人穿上一套人类的衣服。虽然动作看起来像,但因为机器人的肌肉(电机)和骨骼(机械结构)跟人类不一样,直接模仿会导致动作不协调,甚至跑不起来。
  • 这篇论文的做法(量身定做): 他们先拿人类跑步的数据作为“灵感”,然后利用超级计算机进行**“动态优化”**。
    • 比喻: 这就像一位顶级裁缝。他看着模特的照片(人类数据),但会根据机器人的身材(物理限制、平衡能力),重新剪裁衣服。他不仅确保衣服好看,还确保机器人穿上后能真正跑起来,不会摔倒。
    • 成果: 他们生成了一套**“跑步动作库”**,就像一本包含不同速度(从慢跑到冲刺)的“动作字典”,而不是只有一张死板的照片。

第二步:教机器人“听话” (奖励机制与强化学习)

有了动作库,怎么教机器人学会呢?他们使用了强化学习(RL),这就像训练一只小狗。

  • 以前的奖励(Mimic 风格): 只要机器人摆出的姿势和人类差不多,就给奖励。
    • 问题: 机器人可能姿势很像,但跑偏了,或者根本控制不住速度。就像小狗学会了“坐下”的姿势,但你喊“跑”它却不动,或者乱跑。
  • 这篇论文的奖励(CLF-RL 风格): 他们引入了一种**“控制理论”**作为奖励标准。
    • 比喻: 这就像给小狗不仅看姿势,还给它戴上了**“导航仪”和“稳定器”**。
      • 导航仪(目标导向): 如果你跑得方向不对,或者速度没达到我要求的,就没有奖励。
      • 稳定器(控制引导): 如果机器人快要摔倒了,系统会立刻发出“惩罚”,强迫它调整重心保持平衡。
    • 结论: 这种“既看动作,又看结果(速度和平衡)”的奖励方式,让机器人跑得既快又稳。

第三步:从“操场”到“真实世界” (自主导航)

训练好的机器人不能只在实验室里跑,它得去真实世界。

  • 分层控制架构: 作者把机器人想象成一个**“司机 + 乘客”**的组合。
    • 乘客(高层规划): 负责看路、决定去哪里、遇到石头怎么绕。它就像坐在车里看导航的乘客,告诉司机“前面有障碍,往左拐”。
    • 司机(底层控制): 就是刚才训练好的跑步机器人。它不管前面有什么,它只负责执行“向左转”、“加速”、“保持平衡”这些具体指令。
  • 成果: 在户外实验中,机器人不仅能自己跑几百米,还能在遇到障碍物时,瞬间计算出一条新路线并绕过去,就像一位经验丰富的老司机在车流中穿梭。

总结:为什么这很厉害?

  1. 快且稳: 机器人跑出了 3.3 米/秒的速度,这在人形机器人里是非常快的,而且还能跑很久。
  2. 听指挥: 以前的模仿学习机器人只能“按剧本演”,现在的机器人能“听指令跑”。你想让它跑多快、往哪跑,它都能做到。
  3. 真智能: 它不再是只会重复动作的机器,而是能感知环境、规划路线、躲避障碍的自主智能体。

一句话概括:
这篇论文通过**“裁缝式的数据优化”和“导航员式的奖励训练”,把一个人形机器人从只会“模仿动作的笨拙模仿者”,培养成了能在真实世界中自由奔跑、灵活避障的“运动健将”**。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →