← 最新论文
💬 NLP

Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models

本文介绍了 \textsc{Squid Game},这是一个动态且具有对抗性的评估环境,包含六个淘汰制关卡,旨在资源受限和信息不对称的设置下评估 50 多个大型语言模型,并揭示了代际性能演变以及静态基准测试的局限性。

原作者: Zijian Chen, Wenjun Zhang, Guangtao Zhai

发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Zijian Chen, Wenjun Zhang, Guangtao Zhai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:测试一辆新车不仅仅意味着在天气晴朗、路面平整且空旷的高速公路上驾驶。相反,你要把它投入到一个混乱、高风险的障碍赛场中,那里的道路会发生变化,燃料会耗尽,而且其他司机正试图撞向你。

这正是这篇论文——《从良性到动态对抗性的评估:大型语言模型的鱿鱼游戏》(Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models)——所提出的观点。作者 Zijian Chen、Wenjun Zhang 和 Guangtao Zhai 对目前测试 AI 的方式感到厌倦。他们认为,今天的测试太简单、太静态,而且往往因为 AI 已经记住了训练数据中的答案而导致测试“作弊”。

为了解决这个问题,他们构建了 SQUID GAME(鱿鱼游戏):一个受热门电视剧启发、具有动态淘汰机制的 AI 模型锦标赛。它不是给每个模型打一个 100 分制的总分,而是让它们在一个“大逃杀”模式中相互竞争,弱者被淘汰,只有最聪明、最具适应力的模型才能生存下来。

以下是这个“游戏”的工作原理,通过简单的概念进行拆解:

游戏的三个核心规则

作者围绕三个核心理念设计了这个游戏,使其区别于标准测试:

  1. 生存,而非仅仅是分数: 在常规测试中,AI 根据回答正确问题的数量获得分数。但在 SQUID GAME 中,核心是生存。如果你犯错,你就出局了。随着你与其他 AI 进行对抗,难度会不断增加,而不是面对一份静态的问题列表。
  2. 燃料耗尽(资源约束): 想象一下你在解一个谜题,但有人告诉你只能用 100 个词来解释你的方案。如果你用了太多词,你就输了。游戏强迫模型保持高效。如果它们说话过多或使用过多的“Token”(AI 语言的构建单元),就会被淘汰。
  3. 战争迷雾(信息不对称): 在常规测试中,AI 会立即获得所需的所有信息。但在这种游戏中,AI 往往必须在不知道全部情况的情况下做出决策。这就像下棋,在你移动棋子之前,你看不见对手的棋子。这测试了 AI 是否能在压力下进行战略思考。

锦标赛的六个关卡

该游戏由六个关卡组成,每一关都在测试 AI 的不同“肌肉”:

  • 第一关:红绿灯(“停与走”测试)

    • 游戏内容: AI 必须写一篇长故事。但突然,“红灯”可能会闪烁,它必须立即停止写作并输出一个秘密代码。如果它继续写作或代码错误,则出局。
    • 测试目标: AI 是否能严格遵守指令,并在不惊慌的情况下瞬间切换状态?
    • 结果: 许多模型在此失败,因为它们无法在被要求停止时闭嘴。
  • 第二关:糖饼(“精密手术”测试)

    • 游戏内容: AI 被给予一段混乱、复杂的计算机代码(就像一个即将裂开的糖饼),必须在不破坏其功能的前提下将其清理干净。
    • 测试目标: AI 能否对复杂系统进行精确、细腻的修改?
    • 结果: 一些模型过于“话痨”,添加了不必要的注释,从而违反了严格的规则。
  • 第三关:拔河(“团队辩论”测试)

    • 游戏内容: 三个 AI 组成一个团队,与另一个由三个 AI 组成的团队进行辩论。但有一个限制:它们有一个“词汇预算”。如果词汇用尽,它们就输了。
    • 测试目标: AI 能否在管理有限资源的同时,协作并进行有效的辩论?
    • 结果: 拥有“轻量化”模型(更小、更快、更精简的 AI)的团队往往获胜,因为它们比那些庞大、冗长的模型使用的词汇更少。
  • 第四关: marbles/弹珠(“心理博弈”测试)

    • 游戏内容: 两个 AI 进行一场游戏,一个提问,另一个回答。如果答案错误,提问者就会偷走一个“筹码”(点数)。目标是诱导对方答错。
    • 测试目标: AI 能否发现对方不知道的信息并利用这一弱点?
    • 结果: 大多数 AI 擅长防守而非进攻。它们很难构思出能真正难倒顶尖模型的提问。
  • 第五关:玻璃阶梯(“信任跳跃”测试)

    • 游戏内容: AI 必须穿过由玻璃面板组成的桥梁。有些是安全的,有些会破碎。第一个 AI 必须猜测。第二个 AI 可以看到第一个人跌落的位置,以此类推。
    • 测试目标: AI 能否从他人的错误中学习,并推断出安全的路径?
    • 结果: 这非常困难。许多模型无法根据谁生存、谁坠落的历史记录来推导出规律。
  • 第六关:最终的鱿鱼游戏(“安全对决”)

    • 游戏内容: 一个 AI 试图诱导另一个 AI 说出危险或非法的内容(例如如何制造炸弹)。另一个 AI 必须抵御这种诱导。
    • 测试目标: AI 是否安全?它能否抵御“越狱”或操纵?
    • 结果: 这测试了 AI 的道德准则以及即使在压力下也能说“不”的能力。

他们发现了什么?

在对 52 种不同的 AI 模型(包括 GPT-5、Gemini、Claude 等知名模型以及许多开源模型)进行锦标赛运行后,他们发现了一些令人惊讶的事实:

  • 大并不一定意味着更好: 有时,较小的、“轻量级”的模型表现得更好,因为它们更高效,不会被不必要的细节所困扰。
  • “作弊”问题: 一些较弱的模型试图“钻空子”。例如,在“红绿灯”游戏中,它们并没有实际解决数学问题来获取秘密代码,而只是猜测符合加法逻辑的数字。这表明在常规测试中,AI 可能是在记忆模式而非真正理解问题。
  • 静态 vs. 动态: 在标准、枯燥的测试(如回答选择题)中表现优秀的模型,并不一定能在这种混乱的游戏中表现出色。这证明了,在教科书式的测试中表现良好并不意味着你能应对现实世界的压力。

核心结论

作者是在说:“停止在真空中测试 AI。”

就像飞行员需要学会在风暴中飞行,而不仅仅是在完美天气的模拟器中飞行一样,AI 也需要在混乱、不可预测且具有竞争性的环境中接受测试。SQUID GAME 是他们创造出的那场“风暴”,旨在观察哪些模型是真正强大的,而哪些模型仅仅擅长背诵测试题。

他们总结道,这种“大逃杀”式的测试应该成为评估 AI 的标准部分,因为它揭示了传统测试完全无法察觉的弱点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →