← 最新论文
🤖 machine learning

Monte Carlo Permutation Search

本文介绍了蒙特卡洛置换搜索(MCPS),这是一种通用型 MCTS 算法,通过将路径范围的模拟统计信息纳入探索项并推导出一种消除 GRAVE 偏差超参数需求的新加权公式,使其在六边形棋和围棋等游戏中优于 GRAVE 算法。

原作者: Tristan Cazenave

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Tristan Cazenave

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个复杂的谜题,比如围棋或六贯棋,但你没有超级计算机或训练有素的人工智能来告诉你最佳走法。相反,你必须在脑海中推演成千上万个随机未来场景,依靠“猜测与验证”来做决定。这就是一个名为**蒙特卡洛树搜索(MCTS)**的计算机程序的工作原理。

很长一段时间以来,进行这种猜测的最佳方法是一种名为GRAVE的算法。它擅长通过观察过去来预测未来,但这篇论文的作者 Tristan Cazenave 认为:“我们可以做得更好。”

他创造了一种名为**MCPS(蒙特卡洛排列搜索)**的新算法。以下是其工作原理的简单解释:

回顾过去的三种方式

为了决定下一步走什么,MCPS 通过三种不同的方式审视其随机对局(称为“模拟对局”)的历史记录。你可以将它们想象成相机上的三种不同镜头:

  1. “精确路径”镜头(标准视图):
    它查看那些玩家为了到达当前位置而走了完全相同序列的走法,然后执行了我们正在测试的特定走法的对局。

    • 类比: “我沿着主街走,左转,然后买了一杯咖啡。结果如何?”
  2. “顺序无关”镜头(GRAVE 的升级版):
    它查看那些玩家为了到达该位置走了相同的走法,但顺序略有不同,且我们正在测试的特定走法在稍后出现的对局。

    • 类比: “我先买了一杯咖啡,然后沿着主街走,接着左转。成分相同,只是食谱顺序不同。味道还好吗?”
    • 为何有帮助: 在许多游戏中,落子的顺序并不改变最终的棋盘状态。因此,这个镜头让计算机能从更多的对局中学习,而不仅仅是那些顺序完全匹配的对局。
  3. “排列”镜头(MCPS 的新秘密武器):
    这是新增的部分。它查看任何玩家使用了完全相同的一组走法(到达当前位置的路径 + 新走法)的对局,无论这些走法发生的顺序如何。

    • 类比: “我用锤子、螺丝刀和钉子建了一个架子。不管我是先敲钉子还是先拧螺丝,只要用了这三样工具,架子就建好了。这种组合效果如何?”
    • 限制: 在某些游戏中(如 AtariGo),顺序确实很重要,因为游戏可能会提前结束(例如提子)。MCPS 通过智能地对这些走法进行分组来处理这种情况。

“魔法公式”

论文指出,MCPS 并非只选择其中一种视图,而是将它们混合在一起。作者通过数学计算,找到了完美融合这三种信息源的最佳方式。

想象一下制作冰沙。你有三种水果(三种统计数据)。GRAVE 使用固定的配方,有时味道不佳。MCPS 则使用数学上完美的配方,能根据每种水果拥有的数据量自动调整用量。最棒的是?它不需要“口味测试”(即人工设定偏差参数)就能做得恰到好处;数学会自动完成这一切。

在现实世界中的表现

作者在五种不同类型的游戏中测试了 MCPS 与旧冠军(GRAVE)的表现:

  • 六贯棋(完美匹配): 在这种游戏中,走子顺序永远不会改变最终棋盘。MCPS 在这里是大赢家,尤其是在大棋盘上。这就像拥有一张显示所有可能路径的地图,而不仅仅是你走过的那一条。
  • 围棋(深度思考者): 在小棋盘上,两者势均力敌。但在大棋盘上,随着计算机被给予更多思考时间,MCPS 逐渐领先。它更善于利用额外时间深入挖掘最有希望的走法,而旧方法则陷入探索浅层选项的困境。
  • AtariGo(快速终结者): 这是一种先提子者获胜的游戏。在这里,顺序确实很重要。令人惊讶的是,MCPS 仍然获胜,但其优势在小棋盘上最大,因为游戏结束得很快。在大棋盘上,游戏时间过长,使得“顺序无关”的技巧带来的帮助变小。
  • NoGo(稳健的赢家): 这是一种提子者输掉的游戏。MCPS 几乎在所有地方都获胜,以稳定的优势持续击败旧方法。
  • 战争游戏(速度恶魔): 在这个自定义策略游戏中,MCPS 不仅玩得更好,而且玩得更快。它模拟了结束得更快的对局,并更快地找到获胜策略,从而使其能在相同时间内运行更多模拟。

核心结论

该论文声称,MCPS 是一种更智能、更高效的方式,让计算机在没有深度学习或大规模训练的情况下也能玩好游戏。

它的工作原理是认识到:在许多游戏中,你所走的走法集合比走这些走法的顺序更重要。通过统计特定走法集合在随机对局中出现的总次数,MCPS 建立了关于哪些走法更好的更佳“直觉”。这就像一名侦探意识到,即使嫌疑人到达的顺序不同,但他们都出现在现场这一事实才是真正的线索。

其结果是一个通用工具,在几乎所有测试场景中击败了之前的最佳方法,使其成为当你没有超级计算机可用时,游戏人工智能的一个强大新标准。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →