← 最新论文
🤖 AI

MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs

本文介绍了 Mindgames,这是一个包含 2025 年竞赛中 29,571 次交互的多游戏评估环境与数据集,旨在评估大语言模型的社会与战略推理能力,同时揭示其关键局限性,例如脆弱的规则遵循能力以及排行榜结果对环境的具体依赖性。

原作者: Kevin Wang, Anna Thöni, Benjamin Kempinski, Bobby Cheng, Jianzhu Yao, Benjamin Finch, Leon Guertler, Viraj Nadkarni, Yihan Jiang, Aliaksei Korshuk, Alexander Buyantuev, Ilya Makarov, Siyuan Wu, Yu-Chi
发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Kevin Wang, Anna Thöni, Benjamin Kempinski, Bobby Cheng, Jianzhu Yao, Benjamin Finch, Leon Guertler, Viraj Nadkarni, Yihan Jiang, Aliaksei Korshuk, Alexander Buyantuev, Ilya Makarov, Siyuan Wu, Yu-Chi Cheng, Yan-Ru Ju, Ti-Rong Wu, I-Hsuan Chu, Yu-Yu Yang, I-Chen Wu, Yitian Huang, Qinlu Cao, Yiheng Sun, Yuhong Dai, Hongkun Yao, Jingxuan Fu, Jiwei Zhang, Hao Liao, Mossimo Ebeling, Govind Arun, Sadhvik Bathini, Mihir S Arya, Avinash Anish, Aditya Ranjan, Kirtana Sunil Phatnani, Paval KS, Vrushali Mehta, Aravind S, Nikhil Arora, Tanya Upadhyay, Amol Bandagale, Yuan Lu, ChunEn Hsiao, YuTing Lin, Arvin Chung, Jerry John Thomas, Mathieu Laurière, Leshem Choshen, Yoram Bachrach, Pramod Viswanath, Maria Polukarov, Cheston Tan, Tal Kachman, Atlas Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个巨大的数字游乐场,其中的智能体(AI)并非独自玩单人纸牌,而是被迫在实时中相互互动、撒谎、谈判并制定策略。这就是MINDGAMES,一项旨在测试大语言模型(LLMs)理解他人思维能力的新型竞赛与研究项目——心理学家将这种能力称为“心智理论”(Theory of Mind)。

以下是该论文的故事,拆解为简单的概念。

1. 问题所在:AI 擅长考试,却不擅长与人相处

迄今为止,我们通过给 AI 出静态谜题或单次提问(例如:“如果爱丽丝认为鲍勃在撒谎,她会怎么做?”)来测试它们。论文认为,这就像让游泳者站在泳池里踢腿来测试游泳能力一样。这无法告诉你它们是否真的能在波涛汹涌的大海中游泳。

现实生活是混乱的。它涉及:

  • 隐藏信息:不知道对方知道什么。
  • 欺骗:为了占得上风而撒谎。
  • 合作:在目标不同的情况下协同工作。
  • 适应:因为对手改变了策略而调整自己的策略。

作者构建MINDGAMES正是为了模拟那片“波涛汹涌的大海”。这是一个实时竞技场,来自 76 个不同团队的 944 个 AI 智能体在此参加了四项特定游戏。

2. 竞技场:四款游戏,四种不同技能

将这些游戏想象为四个不同的健身房,每个健身房都在锻炼社交智能的不同肌肉:

  • 布洛托上校(The Chess Match,象棋对决):两名玩家将固定数量的兵力分配到三个战场上。你不知道对手将兵力部署在何处。
    • 测试技能对手建模。你能在不交流的情况下,猜出对方在想什么并智胜他们吗?
  • 重复囚徒困境(The Trust Exercise,信任练习):三名玩家自由交谈,然后决定是为了积分合作还是背叛。
    • 测试技能信任与背叛。你能建立声誉、识破谎言并信守承诺吗?
  • 代号(The Secret Handshake,秘密握手):两支队伍,每队两人。其中一人(间谍长)给出一个单词的线索,帮助队友猜出棋盘上的秘密单词,同时不能意外泄露“刺客”单词。
    • 测试技能共同理解。你能通过微小且受限的提示来传达复杂的思想吗?
  • 秘密黑手党(The Detective Game,侦探游戏):六名玩家。其中一些是“黑手党”(彼此秘密知晓身份),另一些是“村民”(试图找出黑手党)。他们通过辩论和投票来淘汰嫌疑人。
    • 测试技能欺骗与推理。你能在找出谁在撒谎的同时,令人信服地撒谎吗?

3. 结果:“错误生存”陷阱

这次竞赛在数据收集方面取得了巨大成功(近 30,000 场游戏!),但它揭示了我们通常排名 AI 时存在的一个惊人缺陷。

“干净”的游戏:
在《布洛托上校》和《囚徒困境》等游戏中,排名合乎逻辑。采用最佳策略的 AI 获胜。这就像一场清晰的赛跑。

“混乱”的游戏:
在《秘密黑手党》和《代号》中,情况变得奇怪。论文发现了一个主要问题,称为**“错误 - 生存混淆”(Error-Survival Confound)**。

想象一场抢椅子游戏,音乐停止,大家必须坐下。如果你是个优秀的舞者但绊倒了,你就会输。但在这些 AI 游戏中,许多玩家因为太不擅长遵守规则而不断绊倒。

  • 在《秘密黑手党》中,“获胜者”并不一定是最好的骗子或侦探。他们只是比别人更少绊倒自己的人。
  • 由于游戏过于复杂,许多 AI 犯了“致命错误”(例如泄露秘密身份或非法投票),从而过早被淘汰。那些仅仅因为没有崩溃而幸存下来的智能体,其排名反而高于那些实际上更聪明但犯了一个小错误的智能体。

教训: 在复杂的社会游戏中,排行榜可能仅仅是在衡量“谁最不笨拙”,而不是“谁最聪明”。

4. 获胜者是如何做到的

论文分析了表现最佳的团队,发现他们不仅仅依赖拥有“更大的大脑”(更多的计算能力)。相反,他们使用了巧妙的工程技巧:

  • “脚手架”方法:获胜者不仅仅是问 AI“你做什么?”,而是给 AI 提供了一份检查清单、一本记忆笔记本和一个用于计算代码的解释器。这就像给学生提供计算器和复习指南,而不仅仅是教科书。
  • 训练与提示:对于较小的 AI 模型,训练它们使用过去的游戏数据效果最好。对于最大、最强大的模型,提示它们使用巧妙的指令(无需重新训练)效果更好。
  • “不要撒谎”的问题:AI 智能体很难撒谎。因为它们被训练得乐于助人且诚实,所以当它们试图虚张声势时,往往会意外暴露自己是“黑手党”。表现最佳的智能体必须被明确教导如何打破这种“诚实”的习惯。

5. 未来的工具箱

作者不仅发布了结果,还将游乐场的钥匙交给了所有人。他们发布了:

  • 数据集:一个包含 29,000 场游戏的庞大图书馆,记录了每一步操作和每一个想法,以便其他研究人员可以研究 AI 如何思考(或失败)。
  • MG-Ref(参考集):一个来自竞赛的“冻结”池,包含最优秀、最稳定的玩家。新的 AI 智能体现在可以离线与这个特定群体进行对战,从而在不依赖实时服务器的情况下获得公平评分。
  • 一种新的衡量方式:他们建议未来的测试不应仅仅关注最终得分。还必须报告 AI 犯了多少错误。如果一个 AI 因为其他人都崩溃了而获胜,那并不是真正的胜利。

总结

MINDGAMES是对 AI 的一次现实检验。它表明,虽然 AI 在玩游戏方面越来越擅长,但它仍然非常脆弱。它难以应对人类社交互动中混乱、长期且充满欺骗的本质。论文得出结论,要真正衡量“社交智能”,我们需要停止仅仅关注谁赢得了游戏,转而关注他们如何玩、犯了多少错误,以及他们的幸存是因为聪明,还是仅仅因为其他人都太笨拙。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →