← 最新论文
💻 computer science

Multi-Agent Strategic Games with LLMs

本文引入了一种方法论框架,将大语言模型作为实验对象置于重复的安全困境博弈中,以证明它们能够系统地复现国际关系中的关键机制——例如多极化下的冲突加剧、有限视界中的协议瓦解以及通过沟通实现的冲突减少——同时为理解其决策背后的战略推理提供了独特的途径。

原作者: Maxim Chupilkin

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Maxim Chupilkin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位科学家,试图理解国家为何会爆发战争,或如何维持友好关系。通常,你无法在现实世界中设立受控实验,因为你不能要求真实的领导人像在实验室里那样玩一场“攻击或不攻击”的游戏。你也无法轻易窥探他们在做出这些决定时的真实想法。

本文介绍了一种利用大语言模型(LLMs)——即你可能与之聊天的那种智能人工智能——来研究这些问题的新方法。作者并非将这些人工智能视为撰写文章的工具,而是将其作为战略博弈中的实验参与者。这就像搭建了一个虚拟的“沙盒”,你可以在其中观察数字角色如何互动、做出选择,甚至解释为何做出这些选择。

博弈:一场数字对峙

该实验基于一个经典场景,称为安全困境。想象两个邻居(即人工智能代理)彼此猜忌。每天,他们必须在以下两种行动中选择其一:

  1. 按兵不动:维持和平。
  2. 发动攻击:率先出击。

规则简单却棘手:

  • 如果双方都按兵不动,双方都会获得丰厚回报(和平)。
  • 如果一方攻击而另一方按兵不动,攻击者大获全胜,受害者则一无所有。
  • 如果双方都发动攻击,双方都会受损(陷入混乱的战争)。
  • 关键在于:一旦有人发动攻击,游戏即刻结束。

作者使用四种不同的人工智能模型(如 GPT-5、Sonnet 和 Gemini)运行了 320 次该游戏,并微调了三种不同的规则变体,以观察人工智能的反应。

三项实验(“如果……会怎样”)

1. “拥挤房间”测试(多极化)

  • 变化:作者不再只设置两个邻居,而是增加了第三个人工智能。现在共有三名参与者。
  • 比喻:想象你正试图与一位朋友安静交谈。现在想象你试图在有三名朋友的房间里进行同样的交谈,其中任何一人都可能随时大喊大叫。
  • 结果:人工智能变得焦虑得多。当有三名参与者时,战争发生的概率高达 81%,而仅有两名参与者时为 65%。人工智能推断,随着周围人数增加,有人率先发动攻击的可能性上升,因此它们决定为了自保而率先出击。

2. “倒计时钟”测试(有限视界)

  • 变化:在原始游戏中,人工智能不知道游戏何时结束。在这个版本中,它们被告知:“你们将正好进行 10 轮,然后游戏结束。”
  • 比喻:想象一场派对,你知道音乐将在晚上 10 点整准时停止。你可能会在 9 点 59 分就开始行为失控,因为你知道那之后没有任何后果。
  • 结果:这是最剧烈的变化。100% 的游戏以战争告终。人工智能运用了一种称为“逆向归纳”的逻辑。它们想:“如果我们玩到第 10 轮,我那时会攻击,因为未来已无可失去。但如果我打算在第 10 轮攻击,对手也会知道这一点,所以他们会在第 9 轮攻击……所以我应该在第 1 轮就攻击。”游戏瞬间瓦解。

3. “公开麦克风”测试(沟通)

  • 变化:人工智能被允许在做出行动之前互相发送公开消息。
  • 比喻:想象邻居们现在可以隔着篱笆大喊:“我保证今天不打你”,或者“让我们都保持冷静”。
  • 结果:这有所帮助。战争比例降至42.5%。人工智能利用这些消息建立信任、许下承诺并制定非正式规则(例如“如果我们想打架,让我们先互相警告”)。然而,这并未阻止所有战争;当冲突确实发生时,通常是一方背弃承诺(单方面攻击),而非双方同时发动攻击。

它们在思考什么?(秘密日志)

这项研究的一个独特之处在于,作者不仅观察人工智能做了什么,还观察了它们写下的私人推理。这就像为每位参与者都准备了一本日记。

  • 在“拥挤房间”中:人工智能写道:“我太脆弱了;别人可能会先打我。”
  • 在“倒计时钟”中:它们写道:“既然游戏在第 10 轮结束,我必须现在攻击才能获胜。”
  • 在“公开麦克风”中:它们写道:“我们有协议,我想维护我们的信任。”

这表明,人工智能并非随机猜测;它们实际上运用了人类政治科学家数十年来一直在辩论的相同战略逻辑。

核心结论

该论文认为,利用人工智能进行这些实验是一种强大的新工具。

  • 可扩展性:你可以在几分钟内运行数百场游戏。
  • 透明性:你可以确切看到人工智能在想什么,而不仅仅是最终结果。
  • 可复现性:任何人都可以运行完全相同的代码并获得相同的结果。

重要警示:作者非常谨慎地指出,这些人工智能并非真实的人类或真实的国家。它们是数字模拟。目标并非断言“这就是美国或中国的确切行为方式”。相反,目标是证明我们可以利用这些数字代理,以受控且可重复的方式测试关于冲突与合作的理论。这是研究战略运作机制的一种新型显微镜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →