Impartial Games: A Challenge for Reinforcement Learning
本文表明,AlphaZero 式的强化学习算法无法在如 Nim 这种公平博弈中达到专家级水平,其原因在于学习抽象数学原理时存在根本性的表示瓶颈,这揭示了简单的超参数微调无法克服它们无法超越记忆状态进行泛化的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,一种特定类型的计算机程序因其能够精通复杂的策略游戏而近来声名大噪。通过对自己进行数百万次的对弈,这些程序学会了做出甚至能让最伟大的人类专家都感到惊讶的招式。它们已成为国际象棋和围棋等游戏的冠军,在这些游戏中,成功取决于识别模式、评估局面以及规划多步行动。其背后的核心理念是:如果一台机器可以通过理解游戏的流程来学会获胜,那么它最终可能学会解决任何复杂问题。然而,这种成功创造了一种虚假的安全感。事实证明,这些机器学习的方式并不具有普适性。存在一类特定的游戏,其规则简单,棋子由双方共有,且获胜策略依赖于隐藏的数学逻辑而非模式识别。在这些游戏中,最先进的人工智能系统也会撞上南墙,无法学会使游戏变得可解的核心原则。
伦敦帝国理工学院和伦敦玛丽女王大学的研究人员决定利用一种名为“Nim”(尼姆博弈)的游戏来调查这一盲点。Nim 是一个由若干堆物体组成的比赛,两名玩家轮流从其中一堆中取走任意数量的物体。目标是成为取走最后一个物体的人。虽然这个游戏看起来很简单,但获胜的秘诀在于涉及堆叠大小二进制数字的一种特定数学计算。对于人类来说,学习这条规则只是理解一个抽象概念的问题。但对于人工智能而言,挑战却截然不同。研究人员想要观察那些曾经征服了国际象棋的学习算法是否也能学会玩好 Nim,如果不能,原因何在。他们构建了一个定制版的著名 AlphaZero 学习系统,并训练它在规模不断扩大的 Nim 棋盘上进行游戏,密切观察计算机的理解力是如何演进的。
结果是显著且具有启发性的。当研究人员在只有五个堆的小型 Nim 棋盘上测试该系统时,计算机表现出了良好的学习能力。它可以稳定获胜,表现得像一位知道如何开局并将比赛引向胜利的冠军。然而,一旦棋盘规模增加到六个或七个堆,系统的表现便迅速崩塌。计算机停止了学习如何获胜。它不再寻找正确的招式,而是开始瞎猜,表现得并不比随机选择移动更好。研究人员发现,问题并不在于游戏过于复杂,也不在于计算机需要更多的训练时间。问题的根源在于计算机大脑(一种神经网络)处理信息的基本方式。这类网络擅长发现事物之间的联系,比如识别出某种国际象棋的布局通常会导致胜利。但它们在处理一种被称为“奇偶性”(parity)的特定逻辑时却极其吃力,这本质上是一种跨越一组物品进行计数是否为奇数或偶数的方法。在 Nim 中,获胜的招式完全取决于这种计数逻辑。
为了理解为什么这很重要,研究人员引入了一种衡量人工智能技能的新方法。他们区分了“冠军”与“专家”。“冠军”是指能够通过将比赛引导至其熟悉的领域从而在起始位置获胜的玩家。然而,“专家”则可以在棋盘上的任何位置(甚至是从未见过的局面)做出完美的招式。研究表明,人工智能可以成为小规模棋盘上的“冠军”,通过记忆正确的开局招式来获胜。但它无法成为一名“专家”。当游戏进入中局或残局,或者当棋盘变大时,计算机无法推导出正确的招式。它的内部指南(本应告诉它哪些招式是好的)变得混乱不堪。它会将高概率分配给一个必败的招式,而忽略掉那个致胜的招式。即使计算机运行了数百万次模拟来检查其选择,它也无法纠正最初的错误,因为它的初始判断偏差得太远了。
研究人员测试了这种失败究竟是由于学习方法本身,还是由于游戏逻辑的难度。他们创建了一个修改版的游戏,其中两名玩家控制不同的堆,且不需要使用奇偶性逻辑来获胜。在这个修改后的版本中,同样的人工智能学习得又快又好,证明了该学习系统本身是具备能力的。这证实了问题不在于训练过程,而在于原版游戏所需的特定数学类型。计算机仅仅无法从它通过自我对弈产生的数据中学习到奇偶性的抽象规则。由于计算机在早期学习阶段犯错而产生的噪声,使得神经网络无法理清潜在的模式。
这一发现挑战了“只要给予足够的数据和计算能力,当前人工智能就能解决任何问题”的观点。它表明,存在某些类型的逻辑推理是这些系统无法自主学习的。研究人员提出,要真正掌握像 Nim 这样依赖抽象数学的游戏及其他复杂问题,未来的人工智能需要以不同的方式构建。他们建议将当前系统的模式匹配能力与一个独立的、能够处理这些特定逻辑规则的符号推理模块相结合。在实现这种改变之前,这些强大的学习系统在某些领域仍将是冠军,但在另一些领域则会保持盲目,无法达到人类凭借单一洞察力即可达到的真正专家水平。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。