这篇论文介绍了一种名为 ABD-NET 的新方法,它让机器人学走路、跑步和跳舞变得更聪明、更快速。
为了让你更容易理解,我们可以把机器人想象成一个正在学习杂技的“身体”,而 ABD-NET 就是给这个身体装上的一个**“超级直觉大脑”**。
1. 以前的机器人是怎么学习的?(像背单词的学生)
在以前的强化学习(RL)中,机器人就像是一个死记硬背的学生。
- 方法:它通过成千上万次的试错来学习。比如,它想抬起腿,就随机动一下,如果摔倒了,就记住“下次别这么动”;如果走稳了,就记住“下次这么动”。
- 问题:这种方法效率很低。而且,如果机器人的身体变重了(比如背了个书包),或者地面变滑了,它之前背的“死知识”就不管用了,必须重新从头学起。
- 现有的改进:有些新方法(如图神经网络 GNN)告诉机器人:“你的腿和身体是连着的,它们应该互相交流信息。”但这就像只告诉学生“同学之间要传纸条”,至于纸条上写什么、怎么传递,还是得靠机器人自己去猜,没有物理规律做指导。
2. ABD-NET 是怎么做的?(像懂物理的杂技演员)
这篇论文的作者认为,机器人身体里其实藏着物理定律。
- 核心灵感:他们参考了机器人学里一个经典的算法,叫“连杆体算法”(Articulated Body Algorithm)。这个算法原本是用来计算:如果你推一下机器人的脚,这股力量会怎么顺着腿、传到膝盖、再传到屁股,最后影响整个身体的运动。
- ABD-NET 的魔法:
- 它不再让机器人从零开始猜“力量怎么传递”。
- 它把**“力量传递的物理结构”**直接写进了机器人的大脑(神经网络)里。
- 比喻:想象机器人是一个多米诺骨牌塔。以前的方法让机器人自己去猜哪块骨牌倒了会推倒哪一块。而 ABD-NET 直接告诉机器人:“记住,骨牌是从下往上倒的,下面的倒了,上面的才会动。”
- 它让机器人从脚(子节点)向头(父节点)传递信息,就像真实的物理惯性一样。虽然它不直接计算复杂的物理公式(因为那太慢且太死板),但它模仿了物理公式的“骨架”,让机器人学会用“物理直觉”去思考。
3. 这个“超级直觉”带来了什么好处?
A. 学得更快(样本效率更高)
- 比喻:就像教一个懂物理原理的学生学骑车,他只需要试几次就能掌握平衡;而教一个不懂物理的学生,他可能摔几百次还在摇摇晃晃。
- 结果:在电脑模拟中,ABD-NET 只需要很少的练习次数,就能学会像人一样走路、像狗一样奔跑,比以前的方法快得多。
B. 适应力更强(鲁棒性)
- 比喻:如果突然给机器人背上一个很重的书包(改变了身体质量),以前的机器人会立刻摔倒,因为它只记得“轻的时候怎么动”。但 ABD-NET 机器人因为懂“惯性传递”的原理,它会想:“哦,现在下面变重了,所以我得用更大的力气去推上面的部分。”
- 结果:即使机器人的身体变重了,或者地面变滑了,它依然能稳稳地走,不需要重新训练。
C. 真的能上真机(Sim-to-Real)
- 成果:作者不仅在电脑里测试,还把这套大脑装到了真实的宇树(Unitree)G1 人形机器人和Go2 四足机器人上。
- 表现:这些真机器人在真实的地面(草地、瓷砖、泥土)上,不仅能快速行走,还能跟着音乐跳复杂的舞蹈,而且反应速度极快(实时运行),完全没有“水土不服”。
4. 总结
简单来说,这篇论文做了一件很酷的事:
它没有教机器人“死记硬背”动作,而是教机器人理解身体运动的“物理逻辑”。
- 以前:机器人是**“盲目试错”**的笨小孩。
- 现在:ABD-NET 让机器人变成了**“懂物理原理”**的聪明学徒。
这让机器人学东西更快、更稳,哪怕环境变了,它也能凭借“物理直觉”迅速调整,真正实现了从虚拟训练到现实世界的完美跨越。
论文技术总结:基于关节体动力学网络的机器人学习先验 (Articulated-Body Dynamics Network)
1. 研究背景与问题 (Problem)
在机器人强化学习(RL)中,将结构先验(如连杆连接关系)融入策略网络已被证明能提高学习效率。然而,现有的方法(如图神经网络 GNN 和 Transformer)主要利用空间结构(即哪些组件相连)来定义信息流,而忽略了动力学属性(即力和运动如何在身体中传播)。
- 核心痛点:现有的策略网络通常从零开始学习特征如何聚合和转换,缺乏物理语义。对于关节体系统(Articulated Systems),惯性量从子连杆向父连杆传播的机制(由正向动力学决定)是系统运动的核心,但这一结构尚未被有效地作为归纳偏置(Inductive Bias)嵌入到策略网络中。
- 研究问题:能否将正向动力学(Forward Dynamics)的计算结构直接嵌入策略架构,作为学习控制策略的有效归纳偏置?
2. 方法论 (Methodology)
作者提出了关节体动力学网络 (ABD-NET),这是一种基于图神经网络(GNN)的新型架构,其核心思想是将Articulated Body Algorithm (ABA) 的计算结构嵌入到策略 Actor 网络中,用可学习参数替代物理量。
2.1 架构设计
ABD-NET 包含三个模块:
- 连杆级观测编码 (Link-wise Observation Encoding):将全局观测 s 映射为每个连杆的独立嵌入向量 {zi}。
- 动力学感知消息传递 (Dynamics-Informed Message Passing):
- 自底向上传播:模仿 ABA 算法,消息仅从子节点(Child)向父节点(Parent)聚合,模拟惯性量的累积过程。
- 可学习参数化:
- 用可学习的基特征 Bi 模拟刚性体惯性 Ii。
- 用可学习的运动基 Wj 模拟关节运动子空间 Sj。
- 贡献计算:子节点 j 对父节点的贡献 vja 通过投影机制计算,模拟 ABA 中去除关节允许方向惯性的过程:
vja=vj−vj⊙(WjWj⊤vj)
其中 ⊙ 为逐元素乘法。
- 正交约束:为了数值稳定性并模拟物理约束,引入辅助损失函数 Lorth,强制 Wj 满足正交性近似,确保投影结构的物理一致性。
- 动作解码 (Action Decoding):利用父连杆的聚合表示 vPA(j) 来生成关节 j 的控制动作。
2.2 训练策略
- 采用无模型强化学习(Model-free RL),直接嵌入到 Actor 网络中,而非作为模型预测器。
- 使用 PPO 算法进行训练,并将正交约束损失加入总目标函数。
3. 主要贡献 (Key Contributions)
- 提出 ABD-NET 架构:首个将正向动力学计算结构(特别是惯性传播机制)直接嵌入策略 Actor 的图神经网络,为策略学习提供了基于动力学的归纳偏置。
- 高效的动力学重构:重新表述了正向动力学中的惯性传播公式,避免了昂贵的矩阵求逆运算,实现了计算高效的训练。
- 广泛的实证验证:
- 在多种形态(人形、四足、单足)和任务上,证明了 ABD-NET 在样本效率、动力学变化下的鲁棒性(泛化性)以及计算效率上均优于 Transformer 和传统 GNN 基线。
- 成功实现了从仿真到现实(Sim-to-Real)的迁移,在 Unitree G1(人形)和 Go2(四足)机器人上进行了实时部署。
4. 实验结果 (Results)
4.1 仿真性能
- 样本效率:在 Genesis 和 SAPIEN 仿真器中,ABD-NET 的收敛速度显著快于基线(BOT, SWAT, GNN, MLP)。在复杂动态任务(如人形行走、单足跳跃)中优势尤为明显。
- 动力学泛化(质量变化):在机器人基础质量增加 1.5-2.0 倍的压力测试中,ABD-NET 表现出极强的鲁棒性。例如,在 Hopper 跳跃任务中,当质量加倍导致身体倾斜时,ABD-NET 能生成足够的纠正力矩恢复平衡,而基线方法(如 SWAT)往往失败。平均性能保留率比最强基线高出 23.9%。
- 表征学习:可视化显示,ABD-NET 学习到的连杆表示能够捕捉到物理上 meaningful 的关系(如对角腿在 trot 步态中的同步振荡)。
4.2 计算效率
- 尽管 ABD-NET 采用自底向上的顺序计算,其 FLOPs 比 Transformer 基线低 3 倍,且推理速度更快(在 RTX 4090 上,Batch Size 2048 时)。
- 在真实机器人上的推理延迟小于 5ms,满足 50Hz 控制频率的要求。
4.3 真实世界部署 (Sim-to-Real)
- 在 Unitree Go2 和 G1 机器人上成功实现了多地形(沥青、草地、瓷砖等)的速度跟踪、横向行走及动态舞蹈动作。
- 验证了该架构能够处理现实世界的动力学差异,并支持实时机载推理。
5. 意义与影响 (Significance)
- 理论创新:打破了传统 GNN 仅利用拓扑连接关系的局限,首次将动力学传播机制作为归纳偏置引入策略网络,证明了物理计算结构对强化学习的高效性。
- 工程价值:提供了一种既高效又鲁棒的机器人控制架构,特别适用于需要快速适应动力学变化(如负载变化、地形变化)的复杂机器人系统。
- 未来方向:该工作为结合模型基于 RL(Model-based RL)和视觉输入(Image-based)的扩展奠定了基础,展示了物理先验在通用机器人智能中的巨大潜力。
总结:ABD-NET 通过模仿自然界中惯性传播的物理规律来构建神经网络,不仅让机器人“学得更快”,还使其在物理环境发生变化时“适应得更稳”,是机器人强化学习领域向物理感知架构迈进的重要一步。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。