✨ 要点🔬 技术摘要
这篇论文介绍了一个名为 Sumo (相扑)的新机器人控制系统。你可以把它想象成给机器人装上了一个“超级大脑”和一个“本能肌肉”,让它们能够像相扑选手一样,用全身的力量去推、拉、抬那些又重又大的物体。
为了让你更容易理解,我们用几个生活中的比喻来拆解这项技术:
1. 核心难题:机器人为什么搬不动大东西?
想象一下,你让一个刚学会走路的婴儿去搬一张沉重的桌子。
如果只靠“死记硬背”(传统的强化学习 RL): 就像让婴儿通过无数次试错来学习怎么搬桌子。如果桌子变了(比如变成了椅子,或者更重了),婴儿就懵了,因为它是专门练过搬那张特定桌子的。
如果只靠“现场计算”(传统的模型预测控制 MPC): 就像让婴儿在搬桌子的瞬间,用大脑里的超级计算机去计算每一块肌肉怎么发力。但这太慢了,而且桌子太重,婴儿还没算完,自己就先摔倒了(系统不稳定)。
2. Sumo 的解决方案:分层合作(大脑 + 肌肉)
Sumo 聪明地结合了这两种方法,搞了一个“双层架构”:
底层(肌肉/本能):预训练的“全身控制策略”
比喻: 这就像是一个经验丰富的健身教练 ,或者机器人的“肌肉记忆”。它已经通过大量的模拟训练,学会了如何保持平衡、如何走路、如何协调四肢。
作用: 它不需要你告诉它“左腿抬多高”,你只需要给它一个模糊的指令(比如“往左走”或“用手推”),它就能自动协调全身关节,稳稳地执行动作。这解决了“容易摔倒”和“计算太慢”的问题。
高层(大脑/策略):实时的“样本规划器”
比喻: 这就像是一个临场指挥的战术教练 。它看着眼前的障碍物(比如一个巨大的轮胎或路障),快速在脑海里模拟几十种推法(“如果我用肩膀顶会怎样?如果我用腿蹬会怎样?”)。
作用: 它不需要重新学习怎么走路,它只需要指挥那个“健身教练”(底层)往哪个方向用力。如果物体变了(比如从轮胎变成了椅子),它只需要调整一下“战术指令”,不需要重新训练“健身教练”。
3. 这项技术有多厉害?(Sumo 的战绩)
论文展示了 Spot(波士顿动力的四足机器人)和 G1(人形机器人)在真实世界和模拟环境中的表现:
力大无穷: Spot 机器人能把一个比它自己还能举起的轮胎 扶正,甚至能把一个比它自己还大的路障 拖走。这就像一只小狗把一辆小汽车推到了路边。
全身协调: 它不是只用爪子抓,而是像相扑选手一样,用身体、腿、手臂一起发力。比如扶正轮胎时,它会用腿顶住,用身体压住,再用手拉。
举一反三(泛化能力): 这是最酷的地方。如果训练时只教它推箱子,换了一个轮胎,传统的机器人可能就不会了。但 Sumo 只需要告诉高层大脑:“现在我们要推的是轮胎,不是箱子”,它就能立刻学会新任务,不需要重新训练 。
4. 为什么这很重要?
以前的机器人要么很灵活但只能做轻活(比如叠衣服),要么很笨重只能做固定动作。Sumo 让机器人变得既灵活又强壮 。
以前的做法: 每遇到一个新任务(比如开门、搬箱子、扶椅子),就要专门训练一个机器人,耗时耗力。
Sumo 的做法: 训练一个通用的“肌肉记忆”(底层),然后给一个通用的“大脑”(高层)。遇到新任务,大脑稍微调整一下策略就行,就像你学会了骑自行车,换辆不同的自行车也能马上骑。
总结
Sumo 就像给机器人装上了一套“通用的肌肉记忆”和一个“灵活的战术大脑”。
它不再需要为了每一个新任务去重新“上学”(训练),而是像人类一样,利用已有的身体能力,根据眼前的情况灵活调整策略。这让机器人真正具备了在复杂、混乱的现实世界中,去处理那些又重又大的物体的能力,比如把倒下的路障扶正,或者把沉重的轮胎搬走。
这项技术让机器人从“只会做固定动作的机器”进化成了“能像相扑选手一样灵活应对突发状况的智能体”。
Sumo: 动态且通用的全身移动操作(Loco-Manipulation)技术总结
1. 研究背景与问题定义
核心问题 :如何让足式机器人(如四足机器人和人形机器人)在移动过程中,动态地操纵大型、重型或几何形状复杂的物体(即“移动操作”或 Loco-Manipulation)。现有挑战 :
传统方法局限 :现有的移动操作研究多集中在准静态的桌面环境,或依赖遥操作/视频模仿学习,未能充分利用物体或机器人的被动动力学特性。
强化学习(RL)的困境 :端到端 RL 虽然能实现敏捷的 locomotion,但在面对新物体和新任务时,往往需要大量的奖励工程(Reward Engineering)、重新训练和计算资源,且难以泛化到训练分布之外。
模型预测控制(MPC)的瓶颈 :基于采样的 MPC 无需训练且灵活,但在高自由度机器人或动力学不稳定的任务中,容易陷入局部最优或发散,且在线搜索的计算成本极高(维数灾难)。
目标 :开发一种框架,使机器人能够利用全身协调(包括腿、躯干和手臂),动态地处理重量超过自身额定负载或尺寸大于自身的物体,并具备极强的泛化能力。
2. 方法论:Sumo 框架
作者提出了一种名为 Sumo 的层次化控制框架,结合了强化学习(RL)的鲁棒性和基于采样的模型预测控制(MPC)的灵活性。
2.1 核心架构
Sumo 采用“高层规划 + 底层策略”的层次化结构:
底层(Low-Level):预训练的通用全身控制策略(Whole-Body Control Policy)
基于 RL 训练(如 Relic 策略),负责处理复杂的接触动力学和全身协调。
输入:高层指令(躯干速度、手臂关节目标等)。
输出:机器人关节级别的电机指令(50Hz)。
作用:将高维的关节控制问题转化为低维的指令空间,稳定了不稳定的动力学系统。
高层(High-Level):基于采样的 MPC 规划器
使用交叉熵方法(CEM)等采样算法进行在线优化。
输入:当前状态估计(机器人和物体)。
输出:优化后的底层策略所需的高层指令(20Hz)。
作用:通过调整代价函数(Cost Function)和物体模型,实时规划接触丰富的操作任务。
2.2 关键技术设计
策略内循环(Policy-in-the-Loop)并行 rollout :
在物理仿真(MuJoCo)中,MPC 不是直接采样关节动作,而是采样底层策略的输入指令 。
优势 :
降低维度 :大幅减少了搜索空间,解决了维数灾难。
稳定性 :利用底层 RL 策略作为稳定控制器,避免了传统单步射击(single-shooting)在不稳定系统上的发散问题。
效率 :简化了代价函数的设计,只需关注操作目标,无需处理底层步态。
测试时泛化(Test-Time Generalization) :
无需重训练 :面对新物体或新任务,只需在测试时修改 MPC 的物体模型 (如质量、几何形状)或代价函数 ,无需重新训练底层 RL 策略。
灵活的动作空间 :MPC 可以灵活选择采样维度(如是否采样腿部动作、躯干姿态、夹爪开合等),适应不同的操作模式(推、拉、扶正、堆叠)。
3. 主要贡献
层次化框架 :提出了一种结合预训练通用全身控制策略与测试时基于采样 MPC 的框架,专门用于解决动态全身移动操作问题。
简化任务复杂度 :实验证明,该层次结构通过减少搜索空间和任务定义复杂度,显著优于端到端 MPC 和端到端 RL。
零样本泛化能力 :展示了通过仅修改规划器的模型或代价函数,即可将同一控制器泛化到未见过的物体和新任务目标,无需重新训练。
广泛的实验验证 :
真实世界 :在 Boston Dynamics Spot 四足机器人上完成了 8 项高难度任务(包括扶正比机器人重且大的轮胎、拖动路障等)。
仿真环境 :在 Unitree G1 人形机器人上完成了推箱子、开门、推桌子等任务。
开源基准 :发布了专注于全身协调移动操作的开源基准和数据集。
4. 实验结果
4.1 仿真对比分析
成功率 :在移动(Move)和扶正(Upright)五类不同物体(箱子、椅子、轮胎、路障、交通锥)的任务中,Sumo 在所有物体上均保持了高成功率(>80%)。
相比之下,端到端 RL 在复杂几何物体(如轮胎)上表现急剧下降;端到端 MPC 则普遍难以收敛。
计算效率 :在超参数调优过程中,Sumo 达到与分层 RL 相当的成功率,但所需的计算时间(墙钟时间)减少了一个数量级 。
泛化性 :
物体泛化 :仅更换物体模型,Sumo 即可成功处理训练集中未出现的物体(如从箱子泛化到轮胎)。
任务泛化 :仅修改代价函数(从“移动到目标”改为“扶正”),即可执行新任务,而 RL 策略无法做到这一点。
4.2 真实世界演示(Spot 机器人)
Sumo 成功完成了以下极具挑战性的任务(成功率 80%-100%):
扶正轮胎 :扶正一个重 15kg 的轮胎(超过 Spot 手臂 11kg 的额定负载)。
扶正路障 :扶正一个重 16kg 且比机器人本身还大的路障。
堆叠轮胎 :将一个轮胎堆叠到另一个轮胎上。
拖动重物 :拖动路障和轮胎架。
推重物 :推动一个 20kg 的箱子。
性能 :平均完成时间在 9 秒到 38 秒之间,展现了极高的鲁棒性。
4.3 人形机器人演示(G1 仿真)
在 Unitree G1 人形机器人上,Sumo 成功实现了推箱子、开门、推椅子和推桌子,证明了该框架不仅适用于四足机器人,也适用于人形机器人。
5. 意义与未来展望
意义 :
突破物理限制 :证明了机器人可以通过全身协调,操纵超出其传统负载能力的物体。
解决 Sim-to-Real 难题 :通过“预训练策略 + 在线规划”的架构,有效缓解了仿真到现实的差距,特别是在接触动力学复杂的场景中。
通用性与灵活性 :提供了一种无需针对每个新任务重新训练即可适应新物体和新目标的解决方案,为开放世界机器人操作提供了新范式。
局限与未来工作 :
感知依赖 :目前依赖外部动捕系统(MoCap)进行状态估计,未来需集成机载感知系统以实现全自主导航和操作。
模型误差 :虽然比纯 RL 更灵活,但仍依赖物理模型,未来可结合系统辨识和在线模型学习来实时更新物体参数。
人类先验 :当前未利用人类先验知识,未来可探索结合预训练的基础模型(Foundation Models)来自动生成奖励或指导行为。
总结 :Sumo 通过巧妙结合 RL 的鲁棒底层控制和 MPC 的在线高层规划,成功解决了足式机器人在复杂动态环境下的全身移动操作难题,为机器人进入真实物理世界执行复杂任务迈出了重要一步。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。