Only the Tens Count, but Trumps Decide: Formalising and Benchmarking Dahal Jeet, a Nepali Variant of Mendikot
本文正式定义了此前未被记载的尼泊尔纸牌游戏 Dahal Jeet,并提出了一个全面的计算基准,证明了基于搜索的智能体优于学习方法,同时揭示了将牌长(trump length)作为比得分牌更强的胜利预测因子,以及控制发牌方差对于准确衡量人类与智能体性能差异的重要性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,研究人员经常通过让他们的创造物在游戏中相互对决来进行测试。这些游戏是科学家的实验室,可以观察计算机程序在学习、规划以及应对不确定性方面的表现如何。有些游戏,如国际象棋,是具有完全信息的游戏,这意味着棋盘上的每一枚棋子对双方都是可见的。而另一些游戏,如扑克或桥牌,则是非完全信息游戏,玩家必须在不知道对手完整手牌的情况下做出决策。几十年来,掌握这类隐藏信息游戏的标准方法是通过试错法来教导计算机,这种方法被称为强化学习。人们一直希望,通过进行数百万次对局,人工智能代理最终能发现超越人类直觉的策略。然而,这种认为“学习总是最佳路径”的假设正受到一种新研究方向的挑战,该研究方向在探讨:在某些特定情况下,另一种思维方式——即基于已知信息进行前瞻性规划——是否可能更为有效。
这个问题在对一种名为“Dahal Jeet”的纸牌游戏的研究中成为了核心议题。这款游戏流行于尼泊尔特赖-马德什(Terai-Madhesh)地区,是“Court Piece”家族的一种变体,由四人组成两组固定的搭档进行比赛。规则看似简单,却营造了独特的战略格局:玩家各发十三张牌,王牌花色由从玩家手中随机抽取决定。目标是赢得小局,但得分的计算方式非常特殊。整副牌中只有四张“十”计入分数。如果一组捕获了三张或更多的“十”,则该队赢得该局。如果“十”被平分(每方各得两个),则由赢得更多小局的一方决定胜负。这造成了一种局面:最重要的牌寥寥无几,且结果往往取决于一个单一的平局判定条件,而非持续的积分积累。
在研究开始之前,这款游戏仅存在于其流行村庄的口头传统中。没有书面的规则手册,没有数字版本,也没有关于其运作机制的科学分析。研究人员的第一步是正式记录这款游戏。他们花费数年时间在七个地区观察玩家,记录实际玩法中的规则,并创建了一个精确的数字版游戏。这使他们能够构建一个能像人类一样精准玩游戏的计算机引擎,从而为测试不同的人工智能策略奠定基础。
随后,研究人员着手研究哪种类型的人工智能能最好地玩转 Dahal Jeet。他们构建了二十六个不同的计算机代理,范围从遵循基本规则的简单程序到使用机器学习随时间进化的复杂系统。他们还加入了使用“确定化搜索”(determinized search)技术的代理。这种方法通过想象许多种隐藏牌的可能版本,为每个版本规划最佳走法,然后选择平均表现最好的那一步。团队让每一个代理与每一个其他代理进行数千场对局,并使用严谨的统计方法以确保结果并非仅仅是运气使然。
研究结果令人惊讶。最成功的代理并非那些通过试错学习的代理。相反,表现最好的代理是那些使用搜索和规划的代理。最强的代理使用了一种特定类型的搜索算法,其评分远高于所有基于学习的系统。事实上,无论如何训练或给予何种奖励,没有任何学习型代理能够击败一套经过精心调优的手写规则。研究表明,在这一特定游戏中,前瞻性观察和计算可能性的能力远比从经验中学习的能力更为强大。
其中一个最引人注目的发现涉及计算机如何“看待”游戏。研究人员原以为,向学习型代理提供更多信息(例如知道哪些牌已经被打出或哪些花色缺失)会帮助它们获胜。然而,他们发现当给予较少信息时,代理的表现反而更好。一个剥离了许多细节的简化版游戏状态,实际上比一个丰富、详细的描述带来了更高的胜率。这表明对于这款特定的游戏,过多的数据可能会干扰学习系统,而简单的视角反而能让它专注于真正重要的内容。
研究还探讨了游戏的结局在多大程度上取决于技术而非运气。通过分析数千手牌,研究人员发现,玩家所发的牌解释了胜负之间近百分之四十的差异。这种高度的随机性意味着,仅仅比较人类与计算机的胜率可能会产生误导。为了获得真正的技能衡量标准,研究人员开发了一种新方法。他们提取人类参与者进行的精确手牌,并在人类的位置上重新运行这些手牌,让计算机代理坐在人类的位置上进行对局。这使得他们能够抵消发牌带来的运气因素,从而观察人类的决策与计算机的决策在相同牌局下的对比。
当使用这种配对方法时,结果发生了变化。虽然计算机对阵人类的整体胜率看起来就像抛硬币一样随机,但配对分析显示,如果计算机玩的是人类手中的牌,它本可以赢得显著更多的手牌。在同样的牌局下,人类输掉的手数大约比计算机多出百分之九。这证明了计算机确实更胜一筹,但这种优势很微弱,极易被发牌的随机性所掩盖。
研究结论指出,对于得分牌稀有且目标复杂的游戏,前瞻性规划是比从经验中学习更可靠的精通之路。这项研究还强调了在概率游戏中衡量成功的重要性。如果不控制发牌的运气因素,我们可能会忽略人类与机器之间真实的技能差距。通过记录一款传统游戏并应用严谨的科学测试,研究人员不仅为人工智能建立了一个基准,也保护了一份文化遗产,展示了即使是在为了娱乐而进行的比赛中,也蕴含着关于我们如何思考以及如何学习的深刻教训。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。