ShuttleArena: Interpretable Self-Play in Physics-Based Badminton
本文介绍了 ShuttleArena,这是一个基于物理机制的羽毛球自博弈环境,该环境采用近端策略优化算法来训练具备可解释性的智能体,使其能够协调击球选择与回位恢复,并证明了此类富含物理特性的领域是开发能够平衡执行、站位及战术预判的交互式人工智能的有效试验场。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,研究人员长期以来一直致力于教计算机如何玩游戏。几十年来,最著名的成功案例来自像国际象棋和围棋这样的棋类游戏,在这些游戏中,规则是固定的,棋子的移动方式是可预测的,且整个游戏状态对所有人都是可见的。近年来,科学家们将注意力转向了视频游戏和体育模拟,这些环境增加了一层物理现实。在这些环境中,智能体不仅必须决定做出什么动作,还必须考虑重力、摩擦力以及对手不可预测的反应。挑战在于,在体育运动中,单一的决策很少是孤立地好或坏;其价值完全取决于接下来会发生什么。如果一名球员击球,那次击球的质量取决于对手是否能接回球,以及击球者随后必须移动到何处以准备下一次交换。这创造了一个复杂的因果网络,令计算机难以理清。
哥伦比亚大学的一位研究人员通过构建一个名为 ShuttleArena 的数字羽毛球场解决了这一问题。羽毛球对于这类研究来说是一个特别具有启发性的运动,因为被击打的物体——羽毛球,其行为方式与球截然不同。它很轻且具有高阻力,这意味着它会迅速减速,且不会遵循简单的、平滑的弧线。为了取得成功,计算机玩家必须选择一条物理上可行的飞行路径,猜测对手会尝试在哪里拦截,然后立即决定下一步要跑向哪里以做好准备。核心难点在于这些选择是相互锁定的:跑向最佳位置取决于刚刚击出的那一球,但那一球的价值又取决于球员能否应对对手的回球。研究人员想要观察他们是否可以教会人工智能掌握这种“击球”与“移动”之间的耦合关系,更重要的是,去理解人工智能究竟是如何学会做到这一点的。
为了解决这个问题,该团队创建了一个模拟系统,其中两个计算机玩家在一系列回合中进行竞争。与可能持续二十分钟并达到二十一分制的完整比赛不同,该系统中的每次训练都是单回合制,当羽毛球落地出界或一名玩家未能回球时,回合即结束。计算机通过试错法进行学习,通过与自己以及自己过去的版本进行对抗来提升。研究人员设计了计算机透明的决策过程。他们并没有要求人工智能从数千种可能性中选择一个巨大的、复杂的动作,而是将决策分解为更小的、可理解的步骤。当需要击打羽毛球时,人工智能首先选择方向,然后是高度,接着是速度,最后是下一步要跑向哪里。这种结构允许科学家观察人工智能的内部机制,看它如何权衡每一个因素。
训练结果表明,计算机学习打羽毛球的方式非常接近人类战术。随着人工智能进行的对攻回合越来越多,它发展出了清晰的策略感。当对手远离或移动缓慢时,人工智能学会了用力深球。当对手在后场等待时,人工智能则切换到较软、较短的球,迫使对手向前奔跑。至关重要的是,人工智能不仅仅学会了击球,它还学会了在击球后移动到正确的位置与击球本身同样重要。研究人员通过冻结人工智能的击球能力,并强制它无论情况如何都每次都跑向球场中心,测试了这一点。这一简单的改变导致人工智能的表现大幅下降,证明了选择智能恢复位置的能力是获胜的关键组成部分。
该研究还利用来自职业赛事的统计数据,将计算机的行为与真实的人类选手进行了对比。虽然计算机并未完美复制人类的动作,但它展现出了可识别的模式。例如,计算机击球的位置往往比人类更靠近边线,这可能是因为它可以在没有人类手臂物理限制的情况下实现精准瞄准。此外,它也会避免在靠近球网时将羽毛球击得很高,这是一个聪明的战术选择,因为这样的球会给对手提供轻松进攻的机会。计算机进行的对攻回合通常比人类的要短,研究人员将这一差异归因于模拟中缺乏人类的疲劳感以及动作的完美执行。
这项工作的意义不仅在于计算机学会了如何打球,还在于研究人员能够精确观察它是如何学习的。通过将游戏分解为具体的选择,他们可以观察人工智能如何根据对手的位置调整策略。他们发现,人工智能学会了将“跑向何处”视为一种战术动作,而不仅仅是击球后的机械步骤。该系统表明,对于人工智能要掌握复杂的物理运动,它必须能够协调动作的执行与下一阶段所需的定位。研究人员总结道,这种基于物理的环境是交互式娱乐人工智能的一个有用的试验场,表明计算机可以学习如何协调动作、定位和战术价值,从而实现既具竞争力又易于人类观察者理解的目标。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。