← 最新论文
🤖 AI

Belief-Guided Decision Making with Uncertainty Gating in the Game of Go

本文提出了一种用于围棋的新颖信念引导(Belief-Guided)架构,该架构通过解耦策略头与信念头来建模认识不确定性,并利用门控机制过滤幻觉,从而通过将计算智能从运行时树搜索转向参数化直觉,使在消费级硬件上实现专业级、无搜索的对弈成为可能。

原作者: Mehrad Yaghoubi, Azam Bastanfard, Abbas Jalilvand, Ashkan Rezaei

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Mehrad Yaghoubi, Azam Bastanfard, Abbas Jalilvand, Ashkan Rezaei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机不仅仅是在进行数值计算,而是真正开始为游戏“思考”的世界。几十年来,科学家们一直试图教会机器掌握古老的围棋,这是一款如此复杂的棋类游戏,其可能的走法数量比宇宙中的原子数量还要多。为了实现这一目标,现代人工智能通常依赖于两个主要工具:一种“直觉”(一个猜测最佳走法的神经网络)和一个“超级计算器”(一种通过模拟成千上万种未来场景来检查该猜测是否安全的搜索算法)。可以将这种“直觉”想象成棋手的直觉,而将“超级计算器”想象成在每一步棋做出之前进行双重检查的裁判。虽然这种组合在庞大且昂贵的超级计算机上表现得极其出色,但在普通的家用计算机上却遇到了瓶颈。这个“超级计算器”对算力的需求如此之高,以至于它会拖慢整个进程;而且如果你强迫它运行得太快,人工智能就会开始犯下那种自信且疯狂的错误——就像一个玩家百分之百确定自己正在获胜,却突然意识到自己刚刚步入了陷阱。这篇论文探讨了一个重大问题:我们能否构建出一种不需要依靠超级计算机进行双重检查,就能像大师一样下棋的人工智能?

这项研究背后的研究人员以围棋为例,提出了一种解决此问题的巧妙新方法。他们不再依赖沉重、缓慢的“超级计算器”来纠正错误,而是赋予了人工智能一种新的内在感知,称为“信念”(Belief)。在他们的新系统中,人工智能拥有两个协同工作的不同大脑。第一个大脑是“策略”(Policy),即通常用于挑选走法的“直觉”。第二个大脑是“信念”,它扮演着内部模拟器或谨慎评论者的角色。这个“信念”大脑不仅仅是在猜测,它会不断地自问:“我对这件事有多确定?这个走法真的安全吗,还是我只是在幻觉中看到了胜利?”

团队建议,通过分离这两个角色,人工智能可以学会更准确地信任自己的“直觉”。他们使用一种特殊的技巧训练了这个新系统,即让“信念”大脑首先从职业对局和专家数据中学习,在进行真正的比赛之前将其扎根于现实。他们还为人工智能添加了一个“记忆”系统,使其能够记住游戏的历史,这对于围棋至称,因为围棋有一个被称为“劫”(Ko)的复杂规则,旨在防止重复完全相同的棋盘状态。

这就是那个“魔术技巧”:研究人员在两个大脑之间构建了一个“门控”(Gate)。如果“策略”大脑过于兴奋并提出了一个高置信度的走法,那么“信念”大脑就会对其进行检查。如果“信念”大脑察觉到不确定性或危险,它就会作为一个过滤器来抑制或拦截这些冒险的走法,防止它们被选中。这阻止了人工智能犯下那些被称为“幻觉”的自信且灾难性的错误。

论文显示,这种方法的效果出奇地好。在测试中,运行在标准消费级显卡(具体为 RTX 2060)上的这种新型“信念引导型”(Belief-Guided)模型,其表现远优于那些因硬件限制而被迫放弃深度搜索的传统模型。结果表明,该模型变得更加稳定,在终局阶段减少了约 30% 的低级错误。作者发现,当“信念”大脑更加具有“自我意识”(即在判断游戏状态时的错误率更低)时,“策略”大脑会做出更好的走法。

然而,论文也谨慎地指出,这并不是解决一切问题的“魔杖”。研究结果是基于特定硬件上的模拟和实验,作者认为,虽然这种方法有助于人工智能在有限的设备上达到专业水平,但它仍然依赖于最初从专家数据中进行的训练。他们认为,他们的方法将繁重的任务从“运行搜索”转移到了“拥有更好的内在信念”上,有效地将验证任务从大规模树搜索转移到了更聪明、更扎实的直觉上。作者总结道,将“做什么”与“我相信什么是真的”进行分离,创造出了一种更强大的人工智能,使其无需随身携带一台超级计算机,也能应对围棋的复杂性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →