GaitSpan: Growing Humanoid Locomotion from Walking to Running
GaitSpan 是一个新颖的框架,它通过利用节奏生成、步幅塑造和残差自适应,在无需从头开始重新学习的情况下,高效地将预训练的步行策略扩展为一种能够跨越多种形态和地形进行行走、慢跑和奔跑的单一连续速度运动控制控制器。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个刚刚学会走路的机器人朋友。它是个出色的步行者,但如果你要求它慢跑或冲刺,大多数当前的机器人都会遇到瓶颈。它们要么陷入僵死状态,要么必须完全“忘掉”走路,从头开始重新学习如何奔跑。这就像是一个人类在决定参加马拉松时,不得不忘记如何用双腿保持平衡,然后从零开始重新学习一切。
这正是 GaitSpan 背后的研究人员试图解决的问题。他们提出了一种更聪明的方法:不要把走路这项技能视为可以丢弃的东西,而是把它当作一颗种子。正如种子包含了整棵树的蓝图一样,一个会走路的机器人已经具备了平衡、支撑和协调的核心“运动结构”。你不需要建造一个新的机器人来跑步;你只需要帮助这个会走路的机器人成长。
三步成长法
GaitSpan 框架就像一个园艺工具包,帮助这颗“走路种子”绽放出奔跑之花。它通过三个特定的技巧来实现这一点:
节奏生成(节拍器):
把机器人的步行策略想象成一首歌。通常,这首歌以一个固定的速度播放。GaitSpan 引入了一系列内部时钟(节拍器),可以让这首歌加速或减速。我们不是在为跑步写一首新歌,而是利用原有的步行曲目,并以不同的节奏来播放它。一个特殊的“混音器”(层级记忆)会学习如何根据机器人被要求的速度,将这些不同的节奏融合在一起。如果你要求它慢跑,它就会混合节奏来创造一个慢跑节拍。如果你要求它奔跑,它会再次调整混合比例。这并不是在切换不同的机器人;它只是在对同一条步行轨道进行重混。步幅塑造(物理教练):
改变节奏固然很好,但跑步不仅仅是走得更快;它涉及到弹跳、腾空以及着地时的冲击。为了教会机器人这一点,研究人员加入了一个受弹簧倒单摆(想象成一个弹力跳跳杆)启发的“物理教练”。这个教练并不会一步步精确地告诉机器人该做什么,而是针对做对了“事情”给予奖励:比如在着地时压缩“弹簧”(腿部)、向上弹起,以及拥有一个双脚同时离地的“腾空”时刻。这鼓励机器人自然地摸索出如何奔跑,而不是被强加于一种僵硬、预设的奔跑模式。残差自适应(微调器):
有时,仅靠节奏和物理教练还不足以让每一个细节都达到完美。机器人可能需要一点点微小的推动,以便在奇怪的斜坡上保持平衡,或者调整手臂摆动的幅度。一个小的“残差”策略充当了微调器的角色,通过添加最后的修正,使动作变得平滑且安全。
他们“不”做的事情(以及为什么这很重要)
论文非常明确地说明了这种方法不是什么。
- 并非“专家切换”: 他们明确排除了训练独立的“专家”(一个用于走路,一个用于跑步)然后尝试进行切换的想法。作者发现,这种方法往往会导致生硬、破碎的过渡,机器人会因为试图从一种技能跳转到另一种技能而踉跄跌倒。GaitSpan 是连续地生长技能,因此从行走到慢跑的过渡就像调大扬声器音量一样平滑。
- 并非“人类模仿”: 他们也反对仅仅复制人类的运动数据。虽然人类擅长奔跑,但人类的身体构造与机器人不同。模仿人类的奔跑可能看起来很酷,但对于具有不同关节和电机的机器人来说,可能会效率低下甚至危险。GaitSpan 建议,机器人可以通过扩展其自身的步行技能来高效奔跑,而不是试图成为人类的模仿者。
结果:从模拟到沙地
团队在五种不同的类人机器人模型(包括 Unit-tree G1 和 Booster T1)上测试了这个想法。他们在虚拟世界(模拟器)中,在平坦地面和略微不平整的地形上对这些机器人进行了训练。
结果令人印象深刻。在这些模拟中,GaitSpan 机器人学会了覆盖一个连续的速度范围,从缓慢行走一直到 2.2 米/秒(这属于快速慢跑或慢跑的速度)。
- 平滑过渡: 当指令速度增加时,机器人不仅仅是加快了速度;它们自然地改变了步态。它们开始迈出更长的步幅,抬高脚步,并最终实现双脚同时离地,创造出如同奔跑者般的“腾空时间”。
- 零样本现实世界成功: 尽管它们仅在模拟中的平坦和轻微不平整地面上接受过训练,但这些机器人在未见过的真实世界地形(如沙地)上也能行走、慢跑和奔跑,无需任何额外训练。这表明它们学到的技能足够强大,能够应对复杂的现实世界。
- 优于同类: 与其他尝试混合不同专家或模仿人类动作的方法相比,GaitSpan 学习得更快,并产生了更稳定、更节能的步态。
核心结论
论文指出,我们不需要将走路、慢跑和奔跑视为三个完全不同的问题。相反,我们可以将走路视为一种种子技能。通过将步行策略视为一个可重用的基础,并通过节奏变化、基于物理的奖励以及微调让其成长,我们可以创建一个能够处理整个运动光谱的单一机器人控制器。
这有点像学习骑自行车。当你决定踩得更快时,你不需要重新学习如何保持平衡;你只是调整重心并用力踩踏。GaitSpan 教会机器人做同样的事:利用它们已经拥有的平衡能力,将其成长为更快速、更动态的运动。虽然这些结果目前是在模拟中展示,并通过“零样本”部署转移到现实世界地形,但它们指向了一个未来:机器人获取新技能不再是通过从头开始,而是通过在已有的知识之上不断构建。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。