想象一下,你正在教一个刚学会走路的“机器人宝宝”(比如宇树科技的 G1 人形机器人)去超市搬箱子。这听起来很简单,对吧?但在机器人世界里,这简直是地狱级难度。
为什么?因为机器人不仅要像人一样走路,手里还要稳稳地拿着东西。如果箱子突然掉了,它得自己发现、自己想办法捡起来,甚至还要一边搬东西一边躲开路上的障碍物。以前的机器人要么太笨,要么太依赖昂贵的“外骨骼”设备(比如外面的摄像头阵列),一旦离开实验室就废了。
这篇论文介绍了一个叫 Pro-HOI 的新系统,它就像给机器人装上了一个**“超级直觉大脑”和“千里眼”**,让它能像人一样灵活、聪明地搬东西。
我们可以用三个生动的比喻来理解它的核心魔法:
1. 指挥棒与舞蹈家:不再死记硬背,而是“看指挥”
(核心技术:根轨迹引导 Root-guided Policy)
- 以前的做法(死记硬背): 以前的机器人学搬箱子,就像背课文。它必须记住:“第一步手抬多高,第二步脚迈多远,第三步身体歪多少度”。如果箱子放的位置稍微变了一点,或者它走的路稍微歪了一点,它就会因为“背错了”而摔倒。
- Pro-HOI 的做法(看指挥跳舞): 这个新系统不再让机器人死记硬背每一个动作细节。相反,它只关注一个核心指令:“你的身体中心(根节点)要去哪里?”
- 这就好比机器人是一个舞蹈家,而“根轨迹”就是指挥棒。
- 指挥棒说:“往左走”,机器人就自动调整手脚去配合,同时手里稳稳拿着箱子。
- 好处: 不管箱子放在哪,不管路有多弯,只要指挥棒(根轨迹)指哪,机器人就能自动调整姿态去配合。这让机器人变得极其灵活,能应对各种没见过的场景。
2. 隐形护盾:把“穿模”变成“严丝合缝”
(核心技术:SDF 损失优化)
- 问题: 在训练机器人时,经常会出现“穿模”现象——机器人的手看起来像是穿过了箱子,或者手和箱子之间有空隙,这在物理上是不可能的。
- Pro-HOI 的魔法(SDF 优化): 作者给机器人装了一个**“隐形护盾”**(基于符号距离场 SDF 的损失函数)。
- 想象一下,机器人的手和箱子之间有一层看不见的“果冻”。如果手穿进了箱子,或者离得太远,这层“果冻”就会发出警报,强迫机器人调整姿势,直到手和箱子严丝合缝地贴合在一起。
- 这让机器人拿东西的动作看起来非常自然、真实,不会像以前那样显得僵硬或穿帮。
3. 数字双胞胎与“后悔药”:东西掉了也能自己捡回来
(核心技术:持久物体估计模块 + 数字孪生 Digital Twin)
- 痛点: 现实世界里,机器人搬着箱子走着走着,万一被绊了一下,箱子“啪”地掉在地上,滚到了摄像头看不见的角落。以前的机器人这时候就“傻”了,因为它看不见箱子,就不知道该怎么办,任务直接失败。
- Pro-HOI 的“后悔药”(数字孪生):
- 这个系统里住着一个**“数字双胞胎”**(一个在电脑里完美模拟物理世界的虚拟机器人)。
- 当现实中的机器人发现“哎呀,手空了,东西掉了!”时,它会立刻告诉“数字双胞胎”。
- “数字双胞胎”会根据箱子掉落时的速度、角度,在虚拟世界里瞬间模拟出箱子滚到了哪里(哪怕它滚到了摄像头看不见的地方)。
- 然后,现实中的机器人会根据这个预测,自动转头、调整姿势,重新把箱子找回来并捡起来。
- 比喻: 就像你打碎了花瓶,虽然碎片滚到了沙发底下看不见,但你的大脑能瞬间算出它大概在哪,然后趴下把它找出来。Pro-HOI 就是拥有这种“脑补”能力的机器人。
总结:它有多强?
作者把这个系统直接装在了宇树 G1(一款真实的人形机器人)上,而且所有计算都在机器人自带的电脑(Jetson NX)上完成,不需要任何外部设备。
- 它能跑: 一边搬箱子一边跑,动作还很帅(像图 1a 那样)。
- 它能躲: 搬着箱子还能灵活地绕过障碍物。
- 它能救场: 就算箱子掉了,它也能自己发现、自己算出位置、自己捡起来,连续搬了15 次都不带停的。
一句话总结:
Pro-HOI 让机器人从“只会背课文的优等生”,进化成了“懂指挥、有直觉、还能自己想办法救场的实干家”。这让人形机器人真正走出实验室,去干点像搬箱子、做家务这样的实事,不再是科幻电影里的梦了。
1. 研究背景与问题定义 (Problem)
人形机器人(Humanoid Robots)在执行通用任务时,人形机器人 - 物体交互(HOI),特别是像“搬运箱子”这样的全身操作任务,仍面临巨大挑战。现有方法主要存在以下局限性:
- 泛化能力差:传统基于模型的方法难以适应未知场景;基于模仿学习的方法往往过度依赖特定的参考运动,难以处理物体位置变化。
- 缺乏通用控制接口:现有方法缺乏能与高层规划器(如导航、避障)无缝集成的通用指令接口,难以同时执行移动和操作任务。
- 鲁棒性不足:缺乏闭环感知机制,当发生物体意外掉落(Slippage/Drop)等故障时,系统无法自主检测并恢复,导致任务失败。
- 奖励工程复杂:端到端强化学习通常需要繁琐的任务特定奖励设计。
核心目标:开发一个通用、鲁棒且可部署的框架,使机器人仅凭机载传感器和计算资源,就能在复杂现实环境中完成长周期的搬运、导航及故障恢复任务。
2. 方法论 (Methodology)
作者提出了 Pro-HOI 框架,包含三个核心模块:
A. 根轨迹引导的强化学习策略 (Root-guided HOI Policy)
- 解耦设计:将运动跟踪目标与观测空间解耦。
- 观测空间 (Observation):仅包含期望的根轨迹 (Root Trajectory)(位置和姿态的偏差 Δp,Δr)以及一个二值化的接触状态指令 ct(是否应接触物体)。
- 奖励函数 (Reward):仅使用参考运动作为奖励信号(Adversarial Motion Priors 思想),而不将其作为观测输入。
- 优势:
- 机器人只需学习根轨迹与任务状态之间的动态关联,无需记忆全身参考运动,从而实现了极高的泛化能力(可适应任意物体位置)。
- 根轨迹作为通用接口,可直接与高层路径规划器(如 TEB)对接,实现“边走边搬”和避障。
- 数据优化:收集人类搬运动作数据,通过 SDF(有符号距离场)损失函数 优化参考运动,消除机器人手部与物体间的穿透伪影,确保物理可行性。
B. 持久化物体估计模块 (Persistent Object Estimation Module)
- 问题:物体掉落出机载相机视野(FoV)后,传统方法无法追踪。
- 解决方案:结合 实时物体检测 (FoundationPose) 与 数字孪生 (Digital Twin)。
- 故障检测:当接触状态指令为“接触”但相对位置偏差超过阈值时,判定为掉落。
- 状态预测:利用 MuJoCo 物理仿真器,基于物体掉落前的最后状态进行高保真物理步进模拟,预测物体落地后的最终姿态。
- 自主恢复:机器人根据预测姿态调整相机视角(Gaze),重新定位并抓取物体。
C. 系统部署与 sim-to-real
- 硬件:部署于 Unitree G1 人形机器人,所有模块(感知、规划、控制)均在单块机载 Jetson NX 上运行。
- 感知:集成 D435i 相机和 Mid-360 激光雷达。
- 训练:采用 PPO 算法,使用非对称 Actor-Critic 架构(Critic 利用 privileged information,Actor 仅使用噪声观测),并加入域随机化(Domain Randomization)以增强鲁棒性。
3. 主要贡献 (Key Contributions)
- 根轨迹引导的 RL 框架:提出了一种无需大量参考运动或复杂奖励工程的 HOI 训练范式。通过根轨迹作为通用接口,实现了与高层规划器的无缝集成,支持导航、避障与搬运的同步进行。
- 持久化物体估计与自主恢复:创新性地结合了实时检测与数字孪生仿真,使机器人能够自主检测掉落、预测物体落点并执行重抓(Re-grasping),显著提升了系统在现实世界中的可靠性。
- 全栈机载部署验证:在 Unitree G1 上完成了端到端部署,所有模块运行于单块机载芯片。实验验证了该方法在泛化性、可扩展性和鲁棒性上均优于现有最先进方法(SOTA)。
4. 实验结果 (Results)
仿真环境 (MuJoCo) 评估
- 泛化性 (OOD 测试):在物体位置和朝向随机变化的分布外(OOD)测试中,Pro-HOI 的抓取成功率达到 99.93%,而基线方法(如 PhysHSI)仅为 82.54%。
- 任务成功率:在 OOD 场景下,Pro-HOI 的任务完成率高达 88.38%,远超其他方法。
- 放置精度:放置误差控制在 6.84 cm 以内,优于基线方法。
- 跟踪性能:在根轨迹跟踪误差(RPE)和接触相位延迟(CPL)上均表现最佳,证明了 SDF 优化和接触状态观测的有效性。
真实世界部署 (Unitree G1)
- 动态鲁棒性:在慢速、中速、快速三种动态指令下,抓取成功率均超过 60%。在连续 28 次搬运测试中(包含多次故意干扰导致物体掉落),系统成功恢复并完成任务。
- 长周期运行:机器人成功完成了 15 个以上 连续的搬运循环,展示了长时程任务的稳定性。
- 故障恢复:在物体意外掉落出视野后,系统能利用数字孪生模块预测位置,调整视角并重新抓取,验证了闭环感知机制的有效性。
5. 意义与价值 (Significance)
- 从实验室到现实应用的跨越:Pro-HOI 解决了人形机器人从“演示特定动作”到“执行通用、长周期、抗干扰任务”的关键瓶颈。
- 无需外部设备:完全依赖机载传感器和计算资源,摆脱了对光学动作捕捉系统(MoCap)的依赖,极大地降低了部署成本和难度。
- 通用接口设计:提出的“根轨迹 + 接触状态”接口为高层规划器提供了标准化的控制方式,使得人形机器人能够像自动驾驶汽车一样,灵活集成导航、避障和操作任务。
- 故障自愈能力:引入数字孪生进行状态估计和恢复,为机器人在非结构化环境中的长期自主运行提供了关键的安全保障。
总结:Pro-HOI 通过解耦观测与奖励、引入根轨迹引导以及结合数字孪生的闭环感知,实现了一种高度通用、鲁棒且可实际部署的人形机器人物体交互方案,是人形机器人迈向通用服务领域的重要一步。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。