这篇论文介绍了一个名为 ULC 的新系统,它的目标是让人形机器人像真人一样,既能灵活地移动(走、跑、蹲),又能精细地操作物体(拿东西、开门、擦黑板),而且这两件事能完美配合,而不是各干各的。
为了让你更容易理解,我们可以把机器人想象成一个正在学艺的杂技演员,而 ULC 就是这位演员的**“超级大脑”**。
1. 以前的做法:像“两个笨拙的搭档”
在 ULC 出现之前,大多数控制机器人的方法就像让两个人合作表演:
- 下半身(腿)的搭档:负责走路、保持平衡。
- 上半身(手)的搭档:负责拿东西、操作。
问题出在哪?
这就好比让两个人背对背跳舞,或者一个人指挥另一个人。虽然他们各自练得不错,但配合起来很生硬。
- 如果腿想蹲下捡东西,手可能还没准备好。
- 如果手要用力推东西,腿可能不知道要调整重心,结果机器人就摔倒了。
- 这种“分头行动”的模式,限制了机器人做复杂动作的能力,就像你很难一边用左手画圆、右手画方,同时还能单脚跳一样。
2. ULC 的突破:像“一个全能的杂技大师”
ULC 的核心思想是:“不要分头行动,我们要一个统一的指挥官。”
它不再把腿和手分开训练,而是训练一个统一的策略(大脑),同时控制全身所有的关节。这就好比那个杂技演员,他的大脑直接指挥每一块肌肉,从脚趾到指尖,协调一致。
ULC 是怎么做到的?(四大“独门秘籍”)
🎓 秘籍一:循序渐进的“特训营” (Sequential Skill Acquisition)
- 比喻:如果你直接让一个新手去演“一边倒立一边弹吉他”,他肯定学不会,甚至会把脑子学坏(遗忘之前的技能)。
- 做法:ULC 采用**“先走稳,再蹲下,最后拿东西”**的训练顺序。
- 先学会怎么走路不摔跤。
- 走稳了,再学怎么控制身体高度(蹲下、站起)。
- 最后才加入复杂的“手眼协调”任务。
- 效果:就像练武术一样,基本功扎实了,再学高难度动作就不会“忘本”。
🎹 秘籍二:平滑的“指挥棒”与“缓冲器” (Interpolation & Delay)
- 比喻:想象你在指挥乐队,如果指挥棒突然从左边跳到右边,乐手会吓一跳,动作会很生硬。而且,现实中发号施令总有延迟(比如网络卡顿)。
- 做法:
- 平滑过渡:ULC 不会让机器人突然“瞬移”到目标位置,而是用数学公式(五次多项式)让动作像流水一样平滑过渡。
- 模拟延迟:它在训练时故意加入“随机延迟”,模拟现实中命令可能晚到的情况。这就像让演员在戴着耳塞、听着有延迟的音乐时跳舞,练好了之后,到了真实世界(没有延迟)反而更稳。
⚖️ 秘籍三:背着重物练功 (Load Generalization)
- 比喻:一个体操运动员如果只练空手动作,一旦背上书包,平衡感就会乱套。
- 做法:ULC 在训练时,会随机给机器人的手腕上挂不同重量的哑铃(模拟提重物)。
- 效果:这让机器人学会了**“重心感知”**。无论手里拿的是轻羽毛还是重砖头,它都能自动调整身体重心,保持不倒。
🛠️ 秘籍四:微调的“修正液” (Residual Action Modeling)
- 比喻:想象你在画画,先画一个大概的轮廓(基础动作),然后用橡皮擦和细笔进行微调,让线条更精准。
- 做法:ULC 不要求大脑从零开始计算每一个关节的精确位置(这太难了)。它先给出一个“大概的动作”,然后让一个**“修正模块”**专门负责处理那些微小的误差和复杂的物理反馈。
- 效果:这让机器人的手部动作既快又准,能完成像“把面包放进微波炉”这样精细的操作。
3. 成果展示:机器人能做什么?
论文展示了 ULC 控制的机器人(Unitree G1)能做很多以前很难做到的事:
- 捡东西:蹲下捡起地上的娃娃,换手,再放到沙发上。
- 推购物车:一边走路一边推,保持平衡。
- 做饭:从桌上拿面包,走到冰箱前,开门,放进去,关门。
- 弹尤克里里:坐着弹奏,手指动作非常细腻。
- 擦黑板:手臂协调配合,把黑板擦干净。
4. 总结
ULC 就像给机器人装上了一个“人类级”的统一大脑。
以前的机器人是“腿走腿的,手干手的”,配合生硬,稍微复杂点就摔倒或动作变形。而 ULC 让机器人全身是一个整体,走路时手在调整,拿东西时脚在配合。
它的核心优势是:
- 更稳:不管手里拿多重,都不会倒。
- 更准:手眼协调像真人一样精准。
- 更灵活:能覆盖以前做不到的动作范围(比如大幅度转身、蹲下)。
这篇论文证明了,**“统一控制”**比“分头控制”更适合让人形机器人真正走进我们的日常生活,去干那些需要手脚并用的复杂活儿。
ULC:人形机器人统一且细粒度的 loco-manipulation 控制器技术总结
1. 研究背景与问题定义 (Problem)
背景:
人形机器人 loco-manipulation(移动操作)旨在将移动能力(下肢)与上半身操作能力(双臂)相结合,以在人类环境中执行复杂任务。现有的主流方法通常采用分层架构(Hierarchical Architectures),将控制策略分解为独立的下肢(移动)和上半身(操作)策略。
核心问题:
- 协调性受限: 这种分解虽然降低了训练复杂度,但本质上限制了子系统之间的协调性,违背了人类全身统一控制的特性。
- 工作空间与精度的权衡: 现有的统一控制器(Whole-Body Controllers)往往难以训练,而解耦方法虽然易训练但牺牲了协调性。此外,基于运动捕捉(MoCap)的方法虽然真实,但受限于数据偏差和可行性,且难以覆盖广泛的指令空间。
- 鲁棒性不足: 在外部负载变化、指令延迟或极端姿态下,现有方法往往表现不佳,难以同时保证跟踪精度、大工作空间和动态稳定性。
目标:
提出一种单一的统一策略(Single Unified Policy),能够在端到端 manner 下同时跟踪根速度、根高度、躯干旋转和双臂关节位置,实现高跟踪精度、大工作空间和强鲁棒性的统一控制。
2. 方法论 (Methodology)
作者提出了 ULC (Unified Loco-Manipulation Controller),这是一个基于大规模并行强化学习(RL)训练的统一控制器框架。其核心创新点包括以下四个关键技术:
A. 顺序技能获取与自适应课程学习 (Sequential Skill Acquisition & Adaptive Curriculum)
为了解决高维指令空间中的探索效率低和灾难性遗忘问题,ULC 采用分阶段学习策略:
- 技能分解: 将任务分解为三个有序阶段:
- T1: 基础速度跟踪(线速度、角速度)。
- T2: 基础高度跟踪(骨盆高度)。
- T3: 躯干旋转与双臂跟踪。
- 自适应门控机制: 引入课程参数 αi(t),基于多指标性能评估(如平均奖励阈值)自动推进课程难度。只有当基础技能(如速度和高度跟踪)达到稳定阈值后,才解锁更复杂的躯干和手臂控制,确保技能积累的稳定性。
B. 指令插值与随机延迟建模 (Command Interpolation & Stochastic Delay)
为了模拟真实部署中的通信延迟并保证运动平滑性:
- 五次多项式插值: 在随机采样的目标位置之间使用五次多项式(Quintic Polynomial)进行平滑插值,确保轨迹在端点处速度和加速度为零(C2 连续),生成物理上合理的参考轨迹。
- 随机延迟释放机制: 模拟现实世界的通信延迟。通过伯努利分布生成随机延迟掩码,将未释放的指令增量累积在缓冲区中,并在后续步骤中释放。这增强了策略对指令突变的鲁棒性。
C. 负载泛化与质心跟踪 (Load Generalization & Center of Mass Tracking)
- 随机负载分布: 在训练过程中,随机改变机器人手腕的负载质量,模拟不同的搬运场景,提升策略的泛化能力。
- 质心(CoM)跟踪奖励: 引入显式的质心投影奖励函数,强制机器人的质心投影保持在支撑多边形(Support Polygon)内。这为策略提供了明确的梯度信号,以在复杂操作和负载变化下维持动态平衡。
D. 残差动作建模 (Residual Action Modeling)
针对双臂控制,采用残差建模策略:
- 最终控制指令 = 策略输出(残差修正) + 期望指令(通过插值和延迟机制生成)。
- 这种设计允许策略专注于学习动态修正和微调,而不是从零重建整个控制信号,从而提高了跟踪精度和训练稳定性。
3. 主要贡献 (Key Contributions)
- 统一框架设计: 提出了一个统一的 loco-manipulation 控制器,通过可行性感知的指令空间设计和渐进式课程学习,实现了多任务(移动 + 操作)的单一策略控制,打破了传统解耦架构的局限。
- 面向部署的训练策略: 结合了随机指令释放(模拟延迟)和显式的平衡优化(质心跟踪),显著提升了 Sim-to-Real(仿真到现实)的迁移能力和对外部负载的鲁棒性。
- 广泛的实验验证: 在 Unitree G1 人形机器人(带三自由度腰部)上进行了大量仿真和实机实验。结果表明,ULC 在跟踪精度、工作空间覆盖率和抗干扰能力上均优于现有的最先进(SOTA)方法。
4. 实验结果 (Results)
实验在仿真环境(Isaac Lab)和真实硬件(Unitree G1)上进行,对比了 HOMIE、FALCON、AMO、R2S2 等主流方法。
- 跟踪精度 (Tracking Accuracy):
- 在全指令空间和边缘指令空间(极端躯干旋转)下,ULC 在所有指标(线速度、角速度、高度、躯干姿态、手臂关节)上的跟踪误差均最低。
- 特别是在双臂跟踪方面,ULC 显著优于依赖 PD 控制或运动捕捉的方法,实现了高精度的细粒度控制。
- 工作空间覆盖 (Workspace Coverage):
- ULC 支持最大范围的高度控制(0.3m - 0.75m)和完整的 3-DoF 躯干旋转(偏航、俯仰、翻滚),而其他方法往往在某些轴向上受限(如 FALCON 限制偏航,AMO 限制翻滚)。
- 鲁棒性测试 (Robustness):
- 负载适应: 在手腕增加 2kg 负载的情况下,ULC 保持了优异的性能,而基于 PD 控制的方法(如 HOMIE, AMO)性能显著下降。
- 指令突变: 在随机指令延迟测试中,ULC 表现出最强的鲁棒性,其他方法(特别是解耦方法)出现严重性能退化。
- 实机演示 (Real-World Results):
- 成功完成了复杂的全身协调任务,包括:
- 玩偶拾取与放置: 涉及下蹲、换手、站立放置,展示了高度控制和动态平衡能力。
- 冰箱任务: 涉及行走、开门、放置面包、关门,展示了多步骤序列操作的精确性。
- 其他演示还包括推购物车、铲沙、弹奏尤克里里、擦拭黑板等。
5. 意义与局限性 (Significance & Limitations)
意义:
- 范式转变: 证明了单一统一策略可以替代传统的分层解耦架构,在保持甚至提升性能的同时,实现更自然的全身协调控制。
- 实用价值: 通过引入随机延迟和负载泛化,极大地提高了策略在真实物理世界中的部署潜力,解决了 Sim-to-Real 转移中的关键痛点。
- 技术突破: 实现了人形机器人在大工作空间内的高精度移动操作,为未来人形机器人执行复杂家务、工业辅助等任务奠定了基础。
局限性:
- 移动模式限制: 由于采用了简化的移动指令(基于根速度/高度),ULC 无法复现基于运动捕捉(MoCap)方法所能实现的复杂腿部运动模式(如特定的步态或舞蹈动作)。
- 未来方向: 作者计划在未来工作中解决这一限制,旨在增强移动表达的丰富性,以应对更复杂的现实世界任务。
总结:
ULC 通过统一控制架构、渐进式课程学习、残差建模和鲁棒性训练技术,成功解决了人形机器人移动操作中的协调性、精度和鲁棒性难题,是目前该领域性能最全面、适应性最强的控制器之一。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。