想象一下,一个名为"Booster T1"的人形机器人正站在仓库里。它的工作是将一个沉重且神秘的箱子推过地面,到达指定位置。难点在于:机器人不知道箱子有多重,不知道地面是滑还是粘,而且由于摄像头有些模糊,它也无法完美地看清箱子。
本文介绍了VOFA(基于力自适应控制的视觉目标推箱系统),这是一个“大脑与身体”协同的系统,能够教会机器人成功推动这些箱子,即使出现意外也能应对。
以下是 VOFA 的工作原理,分解为简单概念:
1. 双脑系统(分层架构)
VOFA 采用两级团队协作模式,就像将军与士兵:
- 将军(高层策略): 这是“远见”部分。它观察摄像头画面(有些噪声,就像糟糕的视频通话)和目标位置。它决定机器人应该去往何处,以及如何相对于箱子定位。它不操心微小的肌肉颤动,只发出“向前移动”或“向左转”等宏观指令。
- 士兵(底层控制器): 这是“肌肉”部分。它接收将军的宏观指令,并计算出机器人身体每个关节的具体动作。关键在于,这部分具备力自适应能力。想象一个人推购物车,车突然被装满了砖块。如果车变重了,这个人会本能地更用力地推,并调整脚步以防摔倒。士兵也会自动做同样的事,无需被告知,就能根据箱子的重量和地面的摩擦力进行调整。
2. 训练营(师生方法)
教机器人做这件事很难,因为在训练过程中无法轻易给它提供世界的“完美视图”。因此,研究人员使用了师生方法:
- 教师: 首先,他们训练了一个拥有“超能力”的“教师”机器人。它能看见箱子的确切重量、地面的确切摩擦力以及机器人关节的完美位置。它利用这些“特权”信息,学会了如何完美地推箱子。
- 学生: 然后,他们训练了一个只有普通摄像头和基本传感器(没有超能力)的“学生”机器人。学生观察教师并尝试模仿其动作。为了让学生更 robust,研究人员在训练期间加入了“视觉噪声”——比如模糊摄像头或添加静态干扰——这样学生就能学会即使在视野混乱(就像现实世界一样)的情况下也能推箱子。
3. “先对齐”技巧
最大的挑战之一是,如果机器人站在错误的一侧试图推箱子,就会失败。研究人员为机器人添加了一个特殊的“奖励”(就像一颗金星),鼓励它先调整位置。
想象一下推一张沉重的沙发。如果你站在侧面,就无法把它向前推。你必须先走到后面。VOFA 自己学会了这个技巧。它会等待,直到自己站在相对于目标而言箱子正后方的完美位置,然后才开始推。这防止了机器人进行“过早接触”并陷入困境。
4. 现实世界结果
团队在真实的 Booster T1 机器人上测试了该系统。结果如下:
- 重负荷搬运: 机器人成功推起了重达17 公斤(约 37 磅)的箱子。这超过了机器人自身重量的一半!机器人甚至在模拟训练中从未接触过这么重的箱子,却能在现场即时掌握。
- 不同角度: 无论目标在前方、侧面,甚至在机器人后方,VOFA 在现实世界中的成功率都超过80%。
- 恢复能力: 如果有人在机器人推箱子时把箱子踢向侧面,机器人不会惊慌。它会停下来,观察箱子去了哪里,绕过去重新对齐,然后继续推。它运行在闭环中,意味着它不断检查周围环境并修正路径,而不是仅仅遵循预设脚本。
总结
VOFA 是一个系统,它让人形机器人仅凭摄像头就能将沉重且未知的物体推到特定目标。它将智能的“远见”规划者与本能地根据重量和摩擦力进行调整的“肌肉”相结合。通过训练学生机器人模仿拥有超能力的教师,同时处理混乱的摄像头数据,该系统学会了推重箱、从碰撞中恢复,并在不摔倒的情况下 navigate 复杂角度。
技术摘要:VOFA——面向人形机器人的基于力自适应控制的视觉目标物体推动
问题陈述
本文解决了仅利用机载自视感知(onboard egocentric perception)实现人形机器人执行目标导向的物体推动( loco-manipulation)的挑战。该能力对于仓库库存重组等现实世界应用至关重要。系统必须在以下三个主要约束下稳健运行:
- 未知的物理属性:机器人必须能够处理质量和地面摩擦系数各异且未知的物体。
- 嘈杂的机载感知:系统不能依赖特权物体状态信息(例如真实物体位置或速度),而必须利用嘈杂的深度图像和本体感知数据运行。
- 闭环适应性:机器人必须实时适应多样化的物体 - 目标配置,包括机器人在建立接触前必须相对于物体和目标重新定位自身的情况。
现有解决方案往往无法同时满足这些标准,要么依赖特权感知,要么缺乏对物理变化的鲁棒性,要么无法在不手动定义阶段的情况下适应不同的目标配置。
方法论
作者提出了VOFA(基于力自适应控制的视觉目标物体推动),这是一个专为Booster T1人形机器人设计的分层两级系统。
1. 分层架构
- 高层视觉运动策略:该策略处理机载观测数据(本体感知和深度图像)及期望的目标位置,以生成高层命令。其运行频率为 50Hz。
- 低层力自适应控制器:该控制器将高层命令转化为关节级动作。它基于FALCON框架,专门设计用于处理末端执行器处 substantial 且未知的外力,确保在与不同质量的物体交互时的稳定性。
2. 训练策略:师生蒸馏
为了克服从嘈杂视觉输入中学习的挑战,VOFA 采用了师生框架:
- 教师策略:使用近端策略优化(PPO)结合特权信息(例如精确的物体朝向、基座线速度和物体状态)进行训练。该策略学习针对目标条件的推动最优行为。
- 学生策略:通过DAgger(数据集聚合)从教师策略中蒸馏而来。学生策略用机载本体感知历史和深度图像替换了特权输入。
- 视觉增强:为了弥合仿真到现实的差距,学生训练结合了视觉随机化,包括远平面深度扰动、相关深度噪声和像素丢弃,以模拟传感器伪影和背景杂乱。
3. 奖励设计
训练利用了一个包含四个关键项的复合奖励函数:
- 到达奖励(Rreach):鼓励两个末端执行器接近物体。
- 推动奖励(Rpush):奖励物体与目标之间距离的减小。
- 头部跟踪奖励(Rtrack):鼓励机器人用摄像头在视觉上跟踪物体。
- 物体 - 目标对齐奖励(Ralign):这是一个新颖的组件,鼓励机器人在推动前将自己重新定位到物体相对于目标的另一侧。这消除了对手动定义训练阶段的需求,并促进了长视野规划,而非短视的接触策略。
4. 仿真与域随机化
训练在Isaac Gym中进行,对物体质量(1–8 千克)、摩擦系数以及初始物体 - 目标位置进行了广泛的随机化。为了解决视觉方面的仿真到现实差距,系统随机化了相机外参(平移和旋转),并模拟了在真实世界深度相机(ZED 2i)中观察到的传感器噪声模式。
主要贡献
- 视觉目标条件系统:引入了 VOFA,这是一个仅使用机载视觉感知即可在多样化的物体 - 目标配置下实现闭环、目标导向推动的系统。
- 对未知质量的鲁棒性:展示了一个能够成功推动具有多样化且前所未见质量的物体的系统,包括高达17 千克的负载(超过机器人自身体重的一半),而无需针对这些特定质量进行重新训练。
- 真实硬件验证:成功部署于Booster T1人形机器人,在仿真和真实世界实验中,针对变化的场景配置和物理属性,均实现了高成功率。
实验结果
该系统在大规模仿真和 Booster T1 的真实世界试验中进行了评估。
- 成功率:VOFA 在仿真中实现了超过90% 的成功率,在真实世界试验中实现了超过80% 的成功率。
- 质量鲁棒性:在真实世界实验中,尽管训练质量上限为 8 千克,该系统仍成功推动了一个17 千克的物体(一个装有 12 千克配重的 5 千克箱子)。
- 配置适应性:该系统在前向、侧向和后向目标配置中均保持了高成功率(学生策略超过 90%)。
- 消融研究:
- 力自适应控制:移除力自适应低层控制器导致成功率显著下降(例如,学生策略从 91.38% 降至 59.32%),并出现“踢”物体等不稳定行为。
- 对齐奖励:移除物体 - 目标对齐奖励导致过早接触失败,特别是在需要重新定位的后向目标配置中。
- 视觉随机化:在没有视觉随机化的情况下训练,由于对背景噪声和域不匹配的敏感性,导致真实世界侧向和后向场景中的性能大幅下降。
- 闭环能力:真实世界演示表明,机器人能够从外部侧向扰动中恢复,补偿重心分布的偏移,并在无需重置的情况下连续将物体推至多个目标。
意义与主张
本文声称,VOFA 代表了在非标定环境中实现稳健、自主的人形机器人 loco-manipulation 的重要一步。通过将高层视觉运动规划与低层力自适应控制解耦,该系统简化了策略训练,同时保持了对物理变化的鲁棒性。
作者强调,物体 - 目标对齐奖励对于使机器人能够学习复杂的长视野行为(推动前的重新定位)而无需手动分阶段至关重要。此外,成功将系统迁移到承载重载(17 千克)的真实世界硬件上,证明了力自适应控制与视觉随机化的结合有效缓解了仿真到现实的差距。
文章最后指出了当前的局限性,具体包括专注于单物体场景以及依赖外部模块进行相对目标定位。未来的工作旨在将该框架扩展到多物体环境,并开发从原始感官输入直接进行物体和目标定位的完全端到端推理。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。