← 最新论文
📈 economics

The Learning Approach to Games

本文提出了一个统一的框架,通过基于学习的玩家的内部结构而非标量策略来重新定义博弈,从而实现对动态行为更深层次的分析,并建立起与强化学习、相关均衡以及平均场理论之间更强的联系。

原作者: Melih İşeri, Erhan Bayraktar

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Melih İşeri, Erhan Bayraktar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:不要盯着棋盘,要盯着玩家

想象你正在观看一场国际象棋比赛。传统博弈论(研究游戏的旧方法)就像是一个站在棋盘高处的裁判。裁判只关心棋子、规则和最终得分。他们会问:“如果双方都发挥完美,游戏最终会走向何方?”他们假设玩家只是简单的机器,总是做出数学上的“最优”移动,以达到一个稳定的状态。

这篇论文认为,这种观点忽略了最重要的部分:玩家的大脑。

作者 Melih İşeri 和 Erhan Bayraktar 指出,真正的玩家(无论是人类还是高级 AI)并不只是简单的计算器。他们是复杂的、混乱的,并且在不断学习。他们有内在的想法、对对手想法的猜测,并且会改变主意。如果你只看游戏的规则,你就会错过玩家试图欺骗、诱导并相互适应的过程中的戏剧性冲突。

新框架:先构建“玩家”

作者并没有从游戏开始,而是首先定义了一个玩家。请不要把玩家看作一个被按下的单一按钮,而要把他看作一个拥有三个主要部门的复杂工厂

  1. 感知(观察): 玩家观察世界。在游戏中,这就是看到棋盘或对手的上一步动作。
  2. 大脑(估计): 这是最酷的部分。玩家不仅是在观察,他们还在进行“猜测”。他们猜测对手下一步会做什么,猜测未来的样子。他们可能同时运行着十几个不同的“猜测引擎”,有的说“对手很激进”,有的说“对手很胆怯”。
  3. 双手(行为): 基于这些猜测,玩家决定如何行动。

论文指出,要理解一个游戏,你必须理解这个工厂是如何运作的。你必须观察“大脑”如何根据“感知”看到的内容来更新其猜测,以及这如何改变了“双手”的行为。

“稳定”并不总是目标

在传统博弈论中,每个人都想达到“纳什均衡”。想象一场舞蹈,每个人都停止了移动,因为他们已经完美同步了。没有人想改变舞步,因为那会破坏舞蹈。

作者说:“这太无聊了,而且这不是真实竞争的方式。”

他们使用了石头剪刀布的例子:

  • 旧方法: “完美”的策略是随机选择石头、剪刀或布(各 1/3 的概率)。如果你这样做,没人能打败你。你是“不可被利用”的。
  • 新方法: 如果你在参加一场锦标赛,而你仅仅是随机玩,你永远不会赢,你只会平局。要真正,你必须更聪明。你必须猜出对手在做什么,然后去欺骗他们。也许你表现得可以预测,以此诱敌深入,然后突然切换策略,让对方措手不及。

论文认为,在真实的竞争中,玩家不断地跳舞、变换舞步,并试图迷惑彼此。他们寻找的不是一种稳定的舞蹈,而是一种优势。

“不确定均衡”

作者引入了一个新概念,叫做不确定均衡 (Uncertain Equilibrium)

这就像是天气预报,而不是一张固定的地图。

  • 旧观点: “下午 2 点会下雨。”(固定、确定)。
  • 新观点: “有 60% 的概率下雨,但如果风向改变,概率可能会变成 90%。”(不确定、动态)。

在他们的模型中,玩家不仅仅是选择一种策略。他们在脑海中构建了一系列不同的“如果……会怎样”的情景。他们可能会尝试一种策略,看到失败后,更新他们的“如果……会怎样”的情景,然后尝试另一种策略。一个“不确定均衡”是指玩家不断循环这些策略的状态,他们从未完全停滞,但在不断回到某些特定动作的节奏中。

一个简单的游戏示例:猫鼠游戏

为了证明他们的观点,作者创建了一个由两名玩家组成的小型简单游戏:

  • 玩家 1 希望处于状态 1。
  • 玩家 2 希望与玩家 1 处于同一状态。

如果他们只是按照“完美的”数学策略来玩,他们会陷入一个谁也赢不了的死循环。但当作者用他们新的“工厂”模型(带有学习和猜测功能)来编写玩家时,玩家开始做一些疯狂的事情:

  • 玩家 2 会假装留在原地以欺骗玩家 1。
  • 玩家 1 意识到这个诡计并切换战术。
  • 他们互相追逐,每隔几秒钟就改变一次想法。

游戏并没有进入一种平静、无聊的模式。它变成了一场动态的、不断变化的舞蹈。这表明,游戏的定义在于玩家学习和改变的能力,而不仅仅是棋盘上的规则。

“平均场”思想:人群

论文还研究了拥有成千上万名玩家的游戏(如交通或股票市场)。这被称为“平均场 (Mean-Field)”。

  • 旧方法: 你试图计算每一个人的行为。这几乎是不可能的。
  • 新方法: 你想象一个“代表性玩家”。这个玩家观察人群并说:“其他人似乎都在做 X。” 然后该玩家学习如何对这个人群做出反应。

作者展示了,即使在人群中,如果你给“代表性玩家”装上一个会学习和猜测的大脑,你会得到一些简单的数学模型所遗漏的有趣模式。

与 AI(强化学习)的联系

最后,论文将其与现代 AI(如玩电子游戏的 AI)联系起来。

  • 旧 AI: “这里有一个获胜奖励。去找通往奖励的路径。”(就像狗追逐零食)。
  • 新视角(来自本论文): AI 正在构建一个复杂的内部模型。它不仅仅是在追逐零食;它正在构建一张世界地图,猜测其他玩家在想什么,并规划未来多个步骤。

作者总结道,要真正理解智能体(人类或机器人)是如何互动的,我们不能只看游戏的规则。我们必须观察玩家内部的“工厂”,看看他们是如何学习、猜测和适应的。

一句话总结

与其将玩家视为仅仅遵循规则以寻找稳定解的简单机器人,本文将他们视为复杂的、具有学习能力的生命体,他们不断进行猜测、欺骗和适应,从而创造出一个比传统数学模型所允许的更加动态且真实的博弈过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →