这篇论文讲述了一个关于机器人如何学会走路和跑步的有趣故事。简单来说,研究人员在问一个问题:给机器人装上一副“有弹性、会偷懒”的身体,是不是比装上一副“死板、全靠电机硬撑”的身体,更容易学会像人一样灵活地运动?
为了回答这个问题,他们做了两个“双胞胎”机器人,并让它们通过“试错”来学习。
1. 两个机器人的“性格”差异
想象一下,你要教两个机器人走路:
机器人 A(被动模型):像一位“弹簧侠”
- 它的身体里装了很多弹簧(就像人的肌腱和肌肉),而且它的关节非常灵活,甚至有点“软”。
- 如果不小心摔倒了,它不会像石头一样硬邦邦地倒下去,而是会像果冻一样弹来弹去。
- 它的关节可以顺着外力转动(高背驱性),这意味着它不需要时刻紧绷着肌肉去对抗重力,而是可以利用重力和地面的反作用力。
机器人 B(扭矩模型):像一位“钢铁侠”
- 它的身体里全是强力电机,关节非常僵硬,像铁棍一样。
- 它没有弹簧,所有的动作都必须靠电机精确地计算并输出巨大的力量来强行控制。
- 它就像是一个时刻紧绷着神经的体操运动员,不敢有丝毫松懈。
2. 学习过程:谁学得更快?谁走得更稳?
研究人员让这两个机器人通过**人工智能(强化学习)**来自己摸索怎么走路和跑步。这就好比给它们一个任务:“走快点,别摔倒,别掉下去”,然后让它们自己尝试。
第一阶段:起步时的“尴尬”
- 机器人 B(钢铁侠):一开始学得非常快!因为它靠蛮力,只要电机转得够快,就能立刻走出几步。它的学习曲线很陡峭,奖励分涨得很快。
- 机器人 A(弹簧侠):一开始学得很慢,甚至有点“笨拙”。因为它太软了,很容易摔倒。在训练初期,它经常摔得四脚朝天,得到的“奖励分”很低。
- 比喻:就像教一个刚学骑自行车的孩子(弹簧侠)和一个骑平衡车的成年人(钢铁侠)。成年人一开始就能骑得很直,而孩子会摔很多次。
第二阶段:发现“魔法节奏”
- 机器人 A 的逆袭:虽然起步慢,但一旦它找到了**“稳定节奏”(科学家称之为极限环**,Limit Cycle),就再也停不下来了。
- 比喻:这就像荡秋千。一开始你得用力推(电机控制),但一旦秋千找到了自然的摆动节奏,你只需要轻轻借力,它就能自己荡得很高、很省力。机器人 A 利用身体的弹簧和地面的反弹,自动找到了这种“省力又省力”的摆动节奏。
- 机器人 B 的困境:虽然它走得快,但它的动作很僵硬,像是在“踢正步”。它没有利用身体的弹性,每一步都要消耗巨大的能量去强行控制关节。
3. 最终结果:谁更厉害?
当训练结束后,两个机器人的表现大不相同:
省力程度(能量效率):
- 机器人 A(弹簧侠):非常节能。它走路时像人一样,膝盖弯曲储存能量,像弹簧一样释放。它消耗的能量只有机器人 B 的四分之一(跑步时甚至更少)。
- 机器人 B(钢铁侠):非常费电。它每一步都要靠电机硬扛,像是在负重训练。
适应能力(鲁棒性):
- 机器人 A:当遇到下坡时,它依然能稳稳地走。因为它的身体是“软”的,地面的变化会被弹簧吸收,它会自动调整节奏。
- 机器人 B:遇到下坡时,它经常往后退或者走不稳。因为它太僵硬了,不知道如何顺应地形,只能死板地执行原来的动作,结果就摔跟头或后退。
动作形态:
- 机器人 A:走路的姿态非常自然,膝盖会弯曲,脚掌会像人一样着地。
- 机器人 B:动作僵硬,像是在机械地踢腿。
4. 核心启示:为什么“软”反而更强?
这篇论文告诉我们一个反直觉的道理:在机器人身上,有时候“软弱”和“弹性”比“强壮”和“控制”更重要。
- 身体的智慧:人类和动物之所以能轻松行走,不仅仅是因为大脑(控制器)聪明,更是因为我们的身体(肌肉、肌腱、骨骼)本身就有弹性。这种**“被动动力学”**(Passive Dynamics)帮助我们把复杂的控制问题简化了。
- 摔倒是好事:对于机器人 A 来说,早期频繁的摔倒并不是坏事。这些摔倒让它的大脑(AI 模型)见识了各种各样的情况,从而学会了如何在各种地形下利用身体的弹性来保持平衡。
- 未来的方向:未来的机器人不应该只是“更聪明的电脑 + 更硬的铁架子”,而应该拥有**“会呼吸的身体”**。通过给机器人装上弹簧、使用灵活的关节,再配合能理解身体物理特性的 AI,我们就能造出既省电、又灵活、还能适应复杂地形的机器人。
总结
这就好比骑自行车:
- 机器人 B 像是在用马达强行控制车轮,每一步都要算得精确,累且容易失控。
- 机器人 A 像是学会了**“找平衡”**,它利用自行车的惯性、车轮的弹性和身体的摆动,轻松自在地滑行。
这篇论文证明了,让机器人拥有“被动”的身体特性,是让它学会像生物一样高效、灵活运动的关键钥匙。
论文技术总结:基于模型强化学习利用被动身体动力学实现高性能双足机器人运动
1. 研究背景与问题 (Problem)
在机器人学与机器学习的交叉领域,具身智能(Embodiment) 日益受到重视,特别是关于机器人身体结构(如肌肉骨骼系统)如何影响控制策略的学习。然而,由于腿式机器人动力学的复杂性(如混合系统特性、飞行相导致的欠驱动问题),如何设计机器人身体结构并据此设计控制器仍不明确。
传统机器人学习通常从零开始构建运动模式,导致控制成本高昂、训练时间长、能量效率低且鲁棒性差。相比之下,人类和动物通过神经、身体与环境的动态交互(如产生稳定的极限环吸引子)实现高效、自然的运动。
核心问题:
- 如何利用基于模型的深度强化学习(Model-Based RL),让机器人自主发现并利用身体动力学中的被动特性(如弹性、高背驱性)来生成高效的运动?
- 具有被动特性的身体结构(如弹簧、高背驱致动器)与传统的刚性伺服电机驱动结构相比,在学习效率、运动性能、能量效率和鲁棒性上有何差异?
2. 方法论 (Methodology)
2.1 机器人模型构建
研究者在 MuJoCo 动力学模拟器中构建了两种具有相同形态(下肢结构、质量分布)但致动机制不同的双足机器人模型:
- 被动模型 (Passive Model):
- 结构: 模仿人类肌肉骨骼,包含线性致动器(模拟股四头肌 VAS 和腓肠肌 GAS)串联弹簧,以及踝关节和足关节的扭转弹簧。
- 特性: 髋关节使用准直驱 BLDC 电机(高背驱性),腿部包含弹性元件。利用被动行走和弹跳杆动力学原理。
- 参数: 6 个致动器(每腿 3 个),包含弹簧和阻尼参数(见表 2)。
- 力矩模型 (Torque Model):
- 结构: 传统人形机器人设计,移除弹簧和气动致动器,替换为高减速比伺服电机(Dynamixel)。
- 特性: 低背驱性,关节刚性高,无被动弹性元件。
- 参数: 6 个伺服电机,通过增加转子惯量模拟低背驱性。
2.2 强化学习框架
- 算法: 采用基于世界模型(World Model)的 DreamerV2 算法。该算法能预测系统动力学并用于控制,有效降低图像状态维度。
- 状态输入: 机器人左后侧对角线的 64x64 灰度图像(Fig. 2)。
- 动作空间: 离散化动作。
- 被动模型:线性致动器力 (fvas,fgas) + 髋关节力矩 (τ)。
- 力矩模型:髋、膝、踝关节力矩 (τhip,τknee,τankle)。
- 双腿动作设为反相以减少动作空间。
- 奖励函数: 基于水平速度 (vx) 和骨盆高度 (z)。
- 目标速度:步行 1.5 m/s,跑步 2.5 m/s。
- 惩罚:速度过低 (<0.2 m/s) 或跌倒 (高度 <0.7 m)。
- 训练设置: 两种模型使用完全相同的超参数、奖励函数和训练步数(500 步/回合,先进行 40 回合随机动作训练世界模型)。
2.3 评估指标
- 学习曲线: 奖励收敛速度与最终值。
- 轨迹分析: 使用 UMAP 将高维关节角度降维至 2D 空间,观察是否收敛为极限环(Limit Cycle)。
- 运动性能: 步态周期、关节运动学(与人类数据对比)、能量消耗(致动器做功)。
- 鲁棒性测试: 在平地训练后,直接在不同坡度(-5°, -3°, +3°)上进行推理测试,无需微调。
3. 关键结果 (Key Results)
3.1 学习效率与收敛性
- 奖励收敛: 力矩模型初期收敛更快,奖励上升陡峭;被动模型初期因易跌倒导致奖励较低,收敛较慢。
- 轨迹结构:
- 被动模型: 在训练早期即被系统的吸引子(Attractor) 捕获,迅速收敛到稳定的极限环(Fig. 4A, C)。
- 力矩模型: 轨迹未收敛到特定的周期性结构,分布较为分散(Fig. 4B, D),表明其运动更多依赖主动控制而非动力学自组织。
3.2 运动形态与能量效率
- 运动形态:
- 被动模型: 关节运动柔和、弯曲。步行时支撑腿像倒立摆(伸展),跑步时关节弯曲储能(类似人类)。
- 力矩模型: 关节运动僵硬,步幅较大,缺乏自然的弹性形变。
- 能量效率: 被动模型显著优于力矩模型。
- 步行: 被动模型 (17.0 kJ) vs 力矩模型 (63.6 kJ)。
- 跑步: 被动模型 (16.5 kJ) vs 力矩模型 (154.9 kJ)。
- 被动模型利用身体弹性实现了极高的能量效率。
3.3 鲁棒性测试 (坡度适应)
- 下坡 (-5°, -3°): 被动模型表现优异,能像平地一样稳定前行;力矩模型常出现后退或无法前行,距离波动大。
- 原因: 被动模型的弹性元件和高背驱性吸收了地形差异,利用重力自然调整步态;力矩模型因刚性控制难以适应。
- 上坡 (+3°): 两者表现均下降,力矩模型因主动注入能量,平均距离略优于被动模型(被动模型依赖被动行走原理,更适合下坡)。
4. 主要贡献 (Key Contributions)
- 验证了被动动力学对强化学习的积极影响: 证明了具有被动特性(弹性、高背驱性)的机器人身体,虽然初期训练困难(易跌倒),但能通过吸引子驱动的学习,最终获得更鲁棒、更节能的运动策略。
- 揭示了“极限环”在学习中的作用: 被动模型通过利用身体与地面动态交互产生的稳定极限环,实现了低维、高效的控制,而无需复杂的显式规划。
- 世界模型与具身设计的协同: 展示了基于世界模型(DreamerV2)的强化学习能够有效利用被动身体的动态特性。早期频繁的跌倒经验反而丰富了世界模型的输入输出关系,构建了更鲁棒的控制器。
- 硬件设计的指导意义: 指出未来的具身 AI 应重视被动属性(如高背驱致动器、弹性元件)的引入,而非单纯追求刚性控制。
5. 研究意义与结论 (Significance & Conclusion)
本研究强调了具身性(Embodiment) 在机器学习中的核心地位。结果表明,机器人不应仅仅被视为需要被精确控制的刚体,其身体的物理特性(特别是被动动力学)是生成高效、适应性运动的关键资源。
- 对于控制理论: 利用系统自身的吸引子(如稳定极限环)可以大幅降低控制维度,提高能量效率。
- 对于机器人设计: 未来的双足机器人设计应融合被动行走原理和弹性元件,配合基于模型的强化学习,以实现类似生物的高性能运动。
- 局限性: 目前仅在仿真中验证,且被动模型中弹性元件与高背驱致动器的被动特性耦合在一起,未来需解耦研究各因素的具体贡献,并推进至实物机器人验证。
总结: 通过结合被动身体动力学与基于模型的强化学习,机器人能够更高效地“发现”适合其自身结构的运动模式,实现比传统刚性控制更稳健、更节能的行走与奔跑。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。