← 最新论文
💻 computer science

Vision-Based Dribbling for Humanoid Soccer via Privileged Representation Learning

本文提出了一种集成强化学习框架,该框架通过在策略中嵌入时间深度编码器,使类人机器人能够直接从车载深度观测中学习针对静态和动态对手的鲁棒视觉足球运球技术,在不依赖显式状态估计或特权信息的情况下实现了高成功率。

原作者: Flavio Maiorana, Valerio Spagnoli, Eugenio Bugli, Flavio Volpi, Daniele Affinita, Vincenzo Suriani, Daniele Nardi, Luca Iocchi

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Flavio Maiorana, Valerio Spagnoli, Eugenio Bugli, Flavio Volpi, Daniele Affinita, Vincenzo Suriani, Daniele Nardi, Luca Iocchi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人足球运动员正戴着一副高科技护目镜,试图在球场上运球前进。现在,想象一下,它的头部并没有一台能够精确掌握球和对手速度与位置的超级计算机,而是必须仅仅通过观察自己眼睛传来的视频流来搞定一切,同时还要努力不让自己摔倒。这正是这篇论文所挑战的疯狂难题。

研究人员构建了一个系统,让类人机器人通过将“视觉”与“运动”结合成一个统一的大脑,来学习运球。通常情况下,机器人的构建就像一场接力赛:第一组负责检测球,将信息传递给第二组进行路径规划,再由第三组驱动腿部运动。但作者认为,这种传统方法就像是在开车时只能看别人画好的地图一样;如果地图稍有偏差,或者球在瞬间被遮挡,驾驶员就会撞车。相反,他们教会了机器人将感知与控制结合在一起进行学习,就像人类学习骑自行车时,是通过感受平衡感,而不是去计算每一次摇晃的物理参数。

为了训练这个机器人,他们使用了一个巧妙的两步走训练营。首先,他们让机器人在视频游戏模拟器中进行练习,在那里它拥有“作弊码”(被称为“特权信息”)。即使球或任何对手在墙后,它也确切地知道它们的位置。机器人在这种“作弊模式”下学会了完美的运球,掌握了如何保持球贴近身体并躲避障碍物。接着,在第二阶段,他们拿走了这些作弊码。他们训练了一个特殊的“视觉编码器”——可以把它想象成一名学生导师——去观察机器人实战中会看到的深度相机视频,并推测出那些“作弊码”数值原本应该是多少。机器人的大脑随后利用这些推测值来进行决策,从而有效地学会了仅靠眼睛来玩这场游戏。

这些训练结果令人印象深刻,但也存在非常明确的局限性。当机器人在空旷的球场上比赛,且没有人试图抢球时,它表现得像个明星,成功率达到了100%。当他们在路径中加入一个静止的障碍物(如锥桶或墙壁)时,它依然表现出色,成功率高达96%,且到达终点的时间仅略微增加了一点。

然而,当机器人面对移动的对手时,情况发生了变化。当另一个被程序设定为追逐球并试图将其撞开的机器人出现时,成功率下降到了46%。在这些模拟实验中,机器人经常摔倒或丢球,并且有**68%**的概率会撞到对手。作者指出,虽然机器人在独立观察和移动方面做得很好,但应对一个正在积极干扰它的、移动中的对手,才是真正的挑战。机器人的眼睛工作正常——它仍然能较好地看到球和对手——但其“大脑”需要学会如何在不摔倒的情况下躲避移动目标,这仍处于开发阶段。

需要记住的是,这一切都发生在一个使用名为 Booster T1 的特定机器人模型的计算机模拟环境中。作者谨慎地表示,这是一个强大的未来基础,但他们尚未在真实的球场上对真实的机器人进行测试。他们提出,这种教导机器人通过视频流进行学习并保持平衡的方法是一条充满前景的道路,但就目前而言,这个机器人仍然是一个虚拟教室里的优秀学生,还没准备好参加世界杯。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →