← 最新论文
💻 computer science

Learning Agile Striker Skills for Humanoid Soccer Robots from Noisy Sensory Input

本文提出了一种四阶段强化学习框架,该框架通过利用真实数据训练教师策略并将其蒸馏至学生策略,再经由约束强化学习与真实噪声建模进行适配,从而弥合仿真到现实的差距,使类人足球机器人能够在噪声感官输入和外部扰动的条件下执行鲁棒的持续踢球动作。

原作者: Zifan Xu, Myoungkyu Seo, Dongmyeong Lee, Hao Fu, Jiaheng Hu, Jiaxun Cui, Yuqian Jiang, Zhihan Wang, Anastasiia Brund, Joydeep Biswas, Peter Stone

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Zifan Xu, Myoungkyu Seo, Dongmyeong Lee, Hao Fu, Jiaheng Hu, Jiaxun Cui, Yuqian Jiang, Zhihan Wang, Anastasiia Brund, Joydeep Biswas, Peter Stone

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下教机器人踢足球。具体来说,你希望它跑过球场,发现一个移动的球,并将其直接踢进球门。现在,想象一下在机器人单脚保持平衡、它的“眼睛”模糊不清、且大脑处理所见信息有时迟缓的情况下完成这一任务。这正是本文所应对的挑战。

德克萨斯大学奥斯汀分校与索尼人工智能(Sony AI)的研究人员开发了一套训练系统,将笨拙的机器人转变为能够应对这些混乱现实条件的“前锋”。以下是他们如何实现这一目标的简要说明,通过简单的类比进行解释。

核心问题:“视力模糊”的运动员

在完美的电子游戏中,机器人确切知道球的位置及其移动速度。而在现实世界中,摄像头存在噪声,数据会出现延迟,球甚至可能在瞬间被遮挡。如果你仅用完美信息来训练机器人,那么一旦它走出计算机环境,就会立刻失败。

本文的目标是训练一个人形机器人连续地踢球(跑动、踢球、转身、再次跑动),即使其感官输入并不完美。

解决方案:四阶段“学校”系统

团队没有试图一次性教会机器人所有技能,而是构建了一个四阶段的训练流程。这就像一所体育学院,有着从“特权教练”到“现实世界球员”的严格进阶过程。

第一阶段:特权教练(远距离追逐)

首先,他们训练一个“教师”机器人。这个机器人拥有超能力:它能完美地看到球和球门,没有任何模糊或延迟。

  • 任务:教师学习如何从远处跑向球,无论球从何处开始。
  • 技巧:他们通过推搡教师或球使其失去平衡,以此教导它如何恢复并保持跑动。这就像教练在蹦床上练习,学习即使地面震动也能保持直立。

第二阶段:完美踢球(定向踢球)

同一个“教师”机器人现在被教导如何踢球。

  • 任务:它学习摆动腿部、击打球,并将球瞄准球门。
  • 技巧:正如第一阶段,他们在机器人尝试踢球时不断推搡它。这迫使机器人学会即使在轻微失去平衡或球移动异常的情况下,也能准确踢球。

第三阶段:学生学习(蒸馏)

现在到了最难的部分。他们引入了一个“学生”机器人。这个机器人是普通的:它的视力模糊,更新缓慢,有时球会从它的视野中消失(比如当球被腿挡住时)。

  • 方法:学生尝试模仿教师。但这里有个关键:学生是通过一种称为DAgger的技术进行训练的。
  • 类比:想象一名学员司机向大师学习。大师驾驶完美,但学员会犯错。当学员猛打方向时,大师不会只说“再试一次”;大师会就在那一刻接管方向盘,向学员展示针对该特定错误的正确操作。学员不仅从大师的完美路径中学习,还学习如何从自己的错误中恢复。

第四阶段:最终打磨(适应)

即使在模仿教师之后,学生机器人仍然有些抖动。由于传感器中的“噪声”让它感到困惑,它会做出尖锐、 jerky 的转向,或者踢得太猛烈。

  • 修正:研究人员使用了一种特殊的“约束强化学习(Constrained RL)”算法。
  • 类比:想象一位严格的健身教练说:“你可以跑得快,但不能扭曲膝盖。”机器人被允许学习,但如果它做出过于抖动或不安全的动作,就会受到惩罚。这平滑了机器人的运动,使其看起来更像一名自然运动员,而不是一个有故障的电子游戏角色。

结果:从模拟到现实

团队通过两种方式测试了该系统:

  1. 在计算机中(模拟):他们将机器人置于数千种不同的场景中。即使带着“模糊的视力”,机器人也有**79.5%**的概率将球踢进球门。
  2. 在现实世界中:他们将代码部署到一台名为Booster T1的真实机器人上。
    • 结果:该机器人在不同位置射门时,成功率达到了66.7%。
    • 效率:机器人还学会了在能量使用上保持明智。如果球靠近球门,它会轻踢以节省能量;如果距离较远,它则会用力踢。

为什么这很重要

论文结论指出,这种“教师 - 学生”方法,结合“约束强化学习”(即那位严格的教练),至关重要。如果没有最后的打磨阶段,机器人在现实世界中就会因过于抖动而无法工作。如果没有“噪声”训练,机器人一旦离开计算机环境就会立刻失败。

简而言之:他们通过让机器人先用完美视力练习,然后强迫它在视力不佳的情况下练习并从自身错误中学习,最后指导它平滑动作以免被自己的脚绊倒,从而教会了一名机器人成为足球前锋。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →