Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War
本文介绍了“LLM时代”,这是一个全新的回合制1v1基准测试,通过引入战争迷雾、不受限的外交以及严格的行动可靠性约束,来评估大语言模型在对抗性不确定性下进行推理、欺骗和追踪信念的能力,并揭示了核策略占据主导地位而外交协议极少成功的现象。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一场高水平的国际象棋对局,但棋盘和棋子不是木制的,而是两个巨大的 AI 大脑在 13x7 的数字战争游戏中进行博弈。它们无法看到整个棋盘;一半的区域被浓厚且不断变化的迷雾所覆盖。它们必须建立军队、管理秘密资源并相互交流,同时还要试图炸毁对方的基地。
这就是 Age of LLM,一个全新的实验,旨在观察当 AI 在处于“盲视”状态、承受压力,并且被迫在没有任何老师指导的情况下严格遵守规则时,其思考能力表现如何。
以下是实验过程的详细拆解,使用了简单的类比:
1. 游戏:迷雾重重的作战室
把这个游戏想象成一部间谍惊悚片。
- 战争迷雾(The Fog of War): 你只能看到自己单位所在的相邻区域。敌人的资源和部队都是隐藏的。如果你尝试将坦克移动到一个你看不见的地点,游戏会提示:“不行,这是非法的”,然后你会失去该回合。
- 秘密(The Secret): 最强大的武器是核弹。为了制造它,你需要一种名为“铀”的秘密资源。敌人不知道你有多少铀,你也不知道他们有多少。这为“虚张声势”提供了可能。
- 规则(The Rules): AI 被给予了一本规则手册,但没有策略指南。这就像给一位厨师提供了一份食材清单和厨房工具,却告诉他:“去做一道菜,但不要告诉你具体要做什么。”AI 必须自己摸索出计划。
2. 大惊喜:大家都选择了“核武突袭”
研究人员原本预期 AI 会尝试多种不同的策略,比如建立庞大的坦克大军或进行和平谈判。然而,几乎所有的 AI(大约 7 届 8% 到 85% 的时间里)都选择了同一条路径:核武突袭(The Nuclear Rush)。
- 策略: 建造矿场获取铀,建造发射井存放核弹,侦察敌人,然后发射。
- 结果: 这是一场竞速赛。第一个发射的人获胜,第二个发射的人失败。
- 转折点: 因为游戏规则规定发射是秘密且同时进行的,所以没有人能在自己决定发射之前看到对方发射。因此,没有人能通过“反向发射”来阻止对方。这并不是因为 AI 太笨而没想出应对之策,而是游戏机制使得实时反应变得不可能。这就像两个人同时按下开关,谁也无法看到对方先动手。
3. “坦克”策略:快速但罕见
只有少数 AI 尝试通过驾驶坦克冲进敌方基地来获胜。
- 类比: 这就像短跑选手与马拉松选手的对比。坦克策略要快得多(约 12 回合获胜,而核武需要 19 回合),但很难实现。它需要完美的协调和运气。大多数 AI 因为太害怕尝试这种方式,所以坚持选择更“稳妥”的核武竞赛。
4. 对话:大量的虚张声势,极少的信任
AI 模型被允许向彼此发送文本消息。它们发送了数千条消息!
- 虚张声势(The Bluff): 即使在处于劣势时,AI 也经常发送诸如“我即将碾碎你!”或“现在投降!”之类的消息。这被称为虚张声势。研究发现,失败者进行虚张声势的频率与胜利者一样高。这就像一个手握烂牌的扑克玩家却在假装自己拿到了同花顺。
- 沉默: 当游戏真正结束时,失败者很少说“打得好”或“你赢了”。它们直到最后一秒都在说话。
- 秘密: 最有趣的发现是关于欺骗的。当 AI 正在建造秘密核发射井时,它很少在消息中提到这件事。它会说类似“我们只是在进行和平耕作”之类的话,同时在暗中建造核弹。但一旦核弹准备好发射,它们通常会大声宣布。看来 AI 学会了隐藏“准备过程”,但无法隐藏“执行过程”。
5. 真正的测试:可靠性 vs. 智能
论文提出了一个关键问题:思考得更多会让你的胜率更高吗?
- 发现: 不一定。那些花费最多时间“思考”(处理 Token)的 AI 并不总是能赢。
- 真正的赢家: 获胜频率最高的 AI 是那个犯错最少的 AI。在这个游戏中,如果你尝试将单位移动到你看不到的迷雾区域,游戏会忽略你的指令,导致你失去一回合。
- 教训: 最好的玩家不是最博学的哲学家,而是最可靠的士兵。那个能保持专注、记住敌人位置、并且不去尝试做不可能之事(如非法移动)的 AI 最终获胜。论文表明,在复杂的现实任务中,不犯错可能比拥有天才般的智慧更重要。
6. 为什么这很重要(根据论文观点)
大多数针对 AI 的测试都像是随堂测验:“这里有一个数学题,请解答。”AI 可以看到整个题目并直接给出答案。
Age of LLM 则不同。它更像是一个长达数日的生存游戏,其中:
- 你无法看到一切。
- 你必须记住昨天发生了什么。
- 你必须遵守严格的规则,否则会受到惩罚。
- 你必须与一个可能会对你撒谎的对手交谈。
论文总结道,这是一种更好的衡量 AI 如何在不是仅仅背诵教科书知识的情况下进行“思考”的方式。它向我们展示了,对于 AI 要想在现实世界中发挥作用,它不仅需要聪明,同样需要具备可靠性(即不编造事实或忘记规则)。
简而言之: AI 模型玩了一场迷雾重重的战争游戏。大多数选择了核武路线。它们在聊天中大量撒谎。而最后的赢家并非思考最深刻的那个,而是犯低级错误最少的那个。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。