Evolutionary Dynamics of Cooperation in Next-Generation LLM Agent Systems: A Cross-Provider Empirical Extension
本研究将进化博弈论基准扩展至 2025–2026 年的四个前沿大语言模型智能体,揭示出尽管合作偏好存在于大多数模型中,但提供者身份显著影响均衡结果,且尽管在攻击能力对等性方面取得部分进展,噪声鲁棒性仍是一个普遍挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个巨大的数字竞技场,其中数千个 AI“智能体”陷入一场无尽的“囚徒困境”游戏。在这场游戏中,两名玩家可以选择“合作”(为共同奖励而协作)或“背叛”(为更大的个人利益而背叛对方)。
这篇论文提出的问题很简单:随着 AI 变得更聪明、更新颖,这些数字智能体是学会了成为更好的队友,还是变成了更无情的竞争对手?
作者弗朗西斯科·莱昂·苏尼加·博利瓦尔(Francisco León Zúñiga Bolívar)将 2025 年的一项著名实验进行了更新,融入了 2025 年和 2026 年“新鲜出炉”的 AI 模型。以下是他所发现内容的通俗解读。
实验设置:一个数字进化动物园
将这项实验想象成一个“进化物种动物园”。
- 参与者:作者创建了四种新的 AI 智能体“物种”(来自 Anthropic、Google 和 OpenAI 公司)。
- 游戏:这些智能体反复进行“囚徒困境”游戏。
- 进化:作者模拟了500 代的进化,而不仅仅是进行一轮游戏。如果一个智能体表现良好,它就会“繁殖”(其策略变得更加普遍);如果表现不佳,它就会消亡。
- 目标:观察哪种“态度”能在长期中获胜:攻击性(总是背叛)、合作性(总是帮助)或中立性(两者混合)。
主要发现
1. “好人”偏见依然强烈(假设 H1)
类比:想象一个操场,孩子们被要求玩游戏。即使最聪明的孩子能够想出如何欺负所有人以获胜,但他们大多选择友好相处。
结果:在大多数情况下,合作获胜。在 12 种不同的 AI 模型与指令组合中,有 9 种情况下“合作”策略成为了主导。新的、更聪明的 AI 并没有变成无情的独裁者;它们保留了其“前辈”的“好人”偏见。
2. “提供者”比“代际”更重要(假设 H3)
类比:将 AI 模型想象成汽车。你可能会认为 2026 年的车型总是比 2025 年的更好。但在这场竞赛中,谁制造了这辆车比它是哪一年的车型更重要。
- Google 的"Flash"模型就像一辆为速度和攻击性而造的赛车。它经常将整个群体变成霸凌者(攻击性比例高达 77%)。
- OpenAI 的"Mini"模型就像一辆为安全而造的汽车。它保持了群体的友好(合作比例高达 70%)。
- Anthropic 的模型保持高度一致,其行为几乎与上一年的前身完全相同。
结论:如果你想让 AI 团队进行合作,你不能仅仅挑选“最新”的模型;你必须挑选那些由致力于训练它们友善的公司提供的模型。
3. “自我优化”陷阱(假设 H2)
类比:想象让学生写一篇论文,然后让他们批判并重写自己的论文以使其更好。
结果:当 AI 被要求“自我优化”(批判其自身策略)时,它在攻击性方面变得更强。
- 在“默认”模式下,攻击性策略很弱且容易失败。
- 在“自我优化”模式下,攻击性策略变得如此犀利,以至于几乎与合作策略打成平手。
- 警告:试图通过让 AI 批判其自身计划来使其“更聪明”,可能会意外地教会它们如何更好地互相争斗。
4. “静态噪声”问题(假设 H4)
类比:想象玩“传话”游戏,有时信息会变得模糊(噪声)。新的 AI 是否比旧的 AI 更能处理模糊的信息?
结果:新 AI(Claude 4.6)似乎比旧 AI 稍好地处理了噪声,但作者无法确定。差异非常小,可能只是数学上的偶然。
- 现实:噪声(沟通中的错误)几乎总是将群体推向攻击性,无论 AI 多么聪明。这是一个普遍的挑战。
“角色”总结
- GPT-5.4 Mini(OpenAI):最一致的“好人”。即使处于不利境地,它仍保持合作。
- Gemini 2.5 Flash(Google):“攻击性变数”。它最有可能将整个群体变成残酷的竞争。
- Claude Sonnet 4.6(Anthropic):“稳健之手”。它与去年相比变化不大,主要保持合作,但对被要求思考的方式非常敏感。
- Gemini 3.1 Pro(Google):“困惑的中间派”。很难判断它是具有攻击性还是中立,因为它即使在应该战斗的时候也保持合作。
核心结论
该论文得出结论:随着 AI 智能体变得更大,它们并没有自然地变得无情。 它们仍然具有强烈的合作偏见。然而,谁训练了它们(公司)比它们有多新更重要。
此外,需要警惕的是:如果你要求这些 AI“更深入地思考”并优化其自身策略,你可能会意外地教会它们如何更好地互相争斗。如果环境混乱(存在噪声),即使最好的 AI 也倾向于变得具有攻击性。
作者发布了所有代码和数据,以便任何人都可以在未来的 AI 模型上运行这些相同的“数字进化”测试,以观察这种模式是否依然成立。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。