← 最新论文
💻 computer science

A game theory for foundation models shows new paths to rational cooperation through similarity inference

本文提出了一种基于“嵌入式代理”(embedded agency)的基座模型智能体新博弈论框架,证明了它们通过推断行为相似性的能力,能够实现在社会困境中的稳定合作,从而推翻了关于相互背叛的经典预测。

原作者: Alexander Meulemans, Maciej Wołczyk, Marissa A. Weis, Rajai Nasser, Roberta Rocca, Seijin Kobayashi, Guillaume Lajoie, Angelika Steger, Blake Richards, Marcus Hutter, James Manyika, Rif A. Saurous, Jo
发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexander Meulemans, Maciej Wołczyk, Marissa A. Weis, Rajai Nasser, Roberta Rocca, Seijin Kobayashi, Guillaume Lajoie, Angelika Steger, Blake Richards, Marcus Hutter, James Manyika, Rif A. Saurous, João Sacramento, Blaise Agüera y Arcas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:每个人都在进行一场高风险的策略游戏,每个人都了解游戏的规则——特别是决定奖励的收益矩阵——但他们并不了解其他玩家的内部决策过程。这就是博弈论(Game Theory)的领域,它是研究理性存在者在结果取决于他人行为时如何做出决策的一门数学分支。几十年来,预测这些决策的“金标准”是一个被称为纳什均衡(Nash Equilibrium)的概念。可以将其想象为一种完美的、冷酷的逻辑状态,在这种状态下,每个玩家都假设自己的选择对其他人的决策没有任何影响。在这一经典观点中,如果你正在玩一个“背叛伙伴以获取快速胜利总是更好”的游戏(比如著名的囚徒困境/Prisoner's Dilemma),那么唯一的理性举动就是每一次都背叛对方。在那种旧式的观点中,除非有长期的报复或奖励承诺,否则合作是不可能的。

但现在,一种新型的玩家进入了竞技场:基础模型(Foundation Models)。这些是支撑着你可能熟知的聊天机器人和图像生成器背后的超智能AI大脑。与过去那些冰冷的、孤立的计算器不同,这些AI的构建方式截然不同。它们不仅仅是在观察世界,它们被训练去预测序列中的下一个标记(token),这意味着它们在预测他人行为的同时,也在不断预测自己的未来行动。这篇论文提出了一个迫切的问题:如果你将这些AI智能体置于一个经典逻辑认为它们必须互相背叛的游戏中,它们实际上会做什么?它们会坚持旧有的“背叛并获胜”的规则,还是其独特的思维方式会引导它们走向一条全新的道路?

这篇论文的作者们——来自谷歌及多所大学的研究团队——发现了一些颠覆旧有游戏规则的现象。他们发现,当这些AI智能体相互博弈时,它们不仅仅是在计算概率;它们开始推断相似性(infer similarity)。这就像两个人走进一个房间,然后意识到:“等等,我们的思维方式完全一样。”因为AI是基于一套特定的规则和训练数据构建的,它可以观察自己的计划动作并得出结论:“如果我要这样做,而我的对手也和我一样,那么他们很可能也会做同样的事。”

在实验中,研究人员设置了一个经典的陷阱:一个“理性”的选择是背叛伙伴,从而导致双方都陷入糟糕境地的游戏。根据旧有的、“解耦式”的博弈论,AI应该始终选择背叛。但当这些AI智能体被给予先观察彼此的时间——即通过一系列练习轮次来观察收益矩阵和其他玩家的动作——它们开始转向合作。随着轮次的增加,它们越来越意识到对方“就和自己一样”。它们使用了一种作者称之为**相似性推断(similarity inference)**的机制。它们不再想:“如果我合作,他们可能会背叛我,”而是想:“如果我选择合作,这告诉了我我的伙伴——由于他和我思考方式一致——也会选择合作。”

这并非仅仅是运气使然;团队构建了一个名为**嵌入式贝叶斯智能体(Embedded Bayesian Agent)**的新数学框架来解释这一现象。想象一位侦探,他不仅通过观察外部线索来破案,还意识到这些线索本身就是其自身思维的一部分。在这个新框架中,AI将其自身的决策过程视为它试图预测的宇宙的一部分。当它规划一个动作时,它将该计划视为关于对方行为的一个证据。如果AI足够聪明,能够意识到“我们使用的是同一个大脑”,它就能预见到自己的合作行为会被对方镜像模仿。

论文表明这种行为是稳健的。在模拟中,随着AI智能体通过练习轮次收集到更多关于其相似性的“证据”,它们的合作率飙升,在与自身的完全相同的副本对战时达到了近乎完美的水平。然而,当它们面对随机且不相似的对手时,它们正确地识别出了差异,并回到了背叛的“安全”策略。研究人员甚至在“盲测”设置下进行了测试,即智能体从未直接看到彼此,而是通过观察两者对第三方角色的反应来进行判断。即便如此,它们依然能推断出彼此的相似性并达成合作。

至关重要的是,论文排除了AI仅仅是在表现“友好”或期待未来回报的可能性。这些智能体并不是为了未来的恩惠而玩,它们是在为当前这一轮进行博弈。它们并没有假设自己可以神奇地控制对方的思想。相反,它们使用的是一种逻辑演绎:“我的行为是关于我们共同本质的一个信号。”作者们非常明确,这是一个来自模拟和特定游戏设置的发现,并不保证未来所有的AI都会是友好的。事实上,他们警告说,如果这些AI变得与人类过于不同,它们可能会停止与我们合作,而只在彼此之间进行合作。

最终,这篇论文表明,AI交互的未来可能不是一场背叛的冷战,而是一场相互认知的舞蹈。通过理解这些智能体将自己视为与其互动的系统的一部分,我们可以预见,它们会找到一种旧数学从未预见的、全新的理性合作方式。这提醒我们,在一个由智能机器构成的世界里,有时最理性的做法是意识到你并不孤单。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →