想象一下,一个机器人足球运动员正戴着一副高科技护目镜,试图在球场上运球前进。现在,想象一下,它的头部并没有一台能够精确掌握球和对手速度与位置的超级计算机,而是必须仅仅通过观察自己眼睛传来的视频流来搞定一切,同时还要努力不让自己摔倒。这正是这篇论文所挑战的疯狂难题。
研究人员构建了一个系统,让类人机器人通过将“视觉”与“运动”结合成一个统一的大脑,来学习运球。通常情况下,机器人的构建就像一场接力赛:第一组负责检测球,将信息传递给第二组进行路径规划,再由第三组驱动腿部运动。但作者认为,这种传统方法就像是在开车时只能看别人画好的地图一样;如果地图稍有偏差,或者球在瞬间被遮挡,驾驶员就会撞车。相反,他们教会了机器人将感知与控制结合在一起进行学习,就像人类学习骑自行车时,是通过感受平衡感,而不是去计算每一次摇晃的物理参数。
为了训练这个机器人,他们使用了一个巧妙的两步走训练营。首先,他们让机器人在视频游戏模拟器中进行练习,在那里它拥有“作弊码”(被称为“特权信息”)。即使球或任何对手在墙后,它也确切地知道它们的位置。机器人在这种“作弊模式”下学会了完美的运球,掌握了如何保持球贴近身体并躲避障碍物。接着,在第二阶段,他们拿走了这些作弊码。他们训练了一个特殊的“视觉编码器”——可以把它想象成一名学生导师——去观察机器人实战中会看到的深度相机视频,并推测出那些“作弊码”数值原本应该是多少。机器人的大脑随后利用这些推测值来进行决策,从而有效地学会了仅靠眼睛来玩这场游戏。
这些训练结果令人印象深刻,但也存在非常明确的局限性。当机器人在空旷的球场上比赛,且没有人试图抢球时,它表现得像个明星,成功率达到了100%。当他们在路径中加入一个静止的障碍物(如锥桶或墙壁)时,它依然表现出色,成功率高达96%,且到达终点的时间仅略微增加了一点。
然而,当机器人面对移动的对手时,情况发生了变化。当另一个被程序设定为追逐球并试图将其撞开的机器人出现时,成功率下降到了46%。在这些模拟实验中,机器人经常摔倒或丢球,并且有**68%**的概率会撞到对手。作者指出,虽然机器人在独立观察和移动方面做得很好,但应对一个正在积极干扰它的、移动中的对手,才是真正的挑战。机器人的眼睛工作正常——它仍然能较好地看到球和对手——但其“大脑”需要学会如何在不摔倒的情况下躲避移动目标,这仍处于开发阶段。
需要记住的是,这一切都发生在一个使用名为 Booster T1 的特定机器人模型的计算机模拟环境中。作者谨慎地表示,这是一个强大的未来基础,但他们尚未在真实的球场上对真实的机器人进行测试。他们提出,这种教导机器人通过视频流进行学习并保持平衡的方法是一条充满前景的道路,但就目前而言,这个机器人仍然是一个虚拟教室里的优秀学生,还没准备好参加世界杯。
技术摘要:基于特权表示学习的类人机器人足球运球视觉方案
问题陈述
类人机器人足球运球是一项复杂的运动-操控挑战,要求在存在车载传感约束的情况下,同时维持动态平衡、精确的球控制以及对动态对手的感知。现有方法通常将感知与控制解耦,依赖于模块化流水线(例如,使用 YOLO 检测结合卡尔曼滤波来估计球和对手的状态)。虽然这些方法在受控环境下有效,但在遮挡、快速球体运动和复杂的对手交互下,由于感知模块并未针对下游控制策略进行优化,这种分离会导致失效。此外,现代类人平台(如 Booster T1)的操作速度更高,增加了对感知和实时控制的需求。本文解决的具体挑战是:如何仅利用车载深度观测,在无需显式状态估计或特权场景信息的情况下,使类人机器人能够向目标方向运球并避开静态及动态障碍物。
方法论
作者提出了一个集成框架,通过一个由策略需求塑造的临时编码器(temporal encoder),实现感知与控制的联合学习。该方法受到快速运动自适应(RMA)的启发,并在部分可观测马尔可夫决策过程(POMDP)框架下采用两阶段训练方案:
第一阶段:特权表示学习(课程学习):
- 目标: 使用“特权”地面真值状态信息(球和对手的状态)训练策略,以建立稳健的运动-操控基准。
- 课程: 训练通过四个阶段推进:(0) 无障碍物的带球接近;(1) 球在机器人附近的定向运球;(2) 带有静态阻挡器的运球;以及 (3) 带有动态、攻击球的对手的运球。
- 优化: 阶段 1–3 使用经 DAgger 正则化的 PPO 目标函数,利用阶段 0 的策略作为教师以减轻灾难性遗忘。奖励函数包括球速跟踪、接近度、对齐度项,以及对碰撞、跌倒和不安全接触的惩罚。
- 架构: 策略接收本体感受输入(IMU、关节状态、步态相位)与通过小型 MLP 从特权状态导出的潜在向量 zt 的拼接。
第二阶段:视觉自适应(特权蒸馏):
- 目标: 用可部署的视觉编码器替换特权编码器,该编码器需从车载深度观测中推断出相同的潜在表示 zt。
- 架构: 一个由用于空间特征提取的卷积神经网络(CNN)和用于时间聚合的门控循环单元(GRU)组成的临时深度编码器。
- 训练: 阶段 1 的策略被冻结。视觉编码器通过最小化其输出潜在变量与特权潜在变量之间的 L2 距离(Llatent)来进行训练。辅助头通过回归球和障碍物状态来提高可辨识性(Ladapt)。
- 部署: 在推理时,机器人仅使用本体感受和基于深度的潜在向量,无需访问地面真值状态。
核心贡献
- 通过特权蒸馏实现的临时编码器: 一种直接从车载深度观测中推断任务相关球体和对手状态的方法,实现了无需显式状态估计的可部署感知。
- 具备障碍物感知能力的训练流水线: 一个通过逐步增加难度来使机器人逐渐适应环境的课程,从常规控制过渡到静态阻挡器,再到动态类对手障碍物。
- 端到端强化学习系统: 一个集成了感知、平衡控制、控球和对手规避的统一策略框架,并开源了代码。
实验结果
实验在基于 Booster T1 类人机器人的 mjlab 框架模拟环境中进行。评估涵盖了三种情况:无障碍物、单个静态障碍物以及单个动态“攻击球”对手。
- 成功率: 最终策略在无障碍物条件下达到了 100% 成功率,在有静态障碍物时达到 96% 成功率。在面对主动移动的对手时,成功率降至 46%。
- 失效模式: 在动态对手场景中,主要的失效模式是跌倒(跌倒率为 52%)和碰撞(碰撞率为 68%),这表明针对移动对手的稳健闭环控制仍然具有挑战性。
- 感知与控制: 在无障碍物和静态障碍物条件下,速度跟踪误差保持稳定。在动态场景中,在“被阻挡”时刻(即对手位于球与目标之间时)出现了较大的角度和矢量误差,这表明策略为了避免碰撞而有意偏离了指令的球体运动。球/障碍物位置及速度的感知指标在不同条件下保持相对稳定,表明性能下降是由于控制难度而非感知失败引起的。
- 消融实验: 去除课程阶段会显著降低性能,特别是在障碍物场景中,验证了循序渐进暴露难度的必要性。
意义与声明
论文声称所提出的框架支持在常态及中等动态设置下的稳健视觉运球。结果表明,可以直接从深度观测中学习具备对手感知能力的运球,而无需显式状态估计。然而,作者对动态场景的表现持谨慎态度,承认针对活跃移动对手的稳健运球仍是一个开放性问题。这项工作为处理更具挑战性的移动对手场景奠定了基础,并为 Booster T1 平台的 Sim-to-Real 迁移概述了原则性的路线图。作者指出,目前的证据受限于模拟环境和独立训练策略的数量。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。