← 最新论文
🤖 AI

ProxyWar: Dynamic Assessment of LLM Code Generation in Game Arenas

本文介绍了 ProxyWar,这是一个通过将智能体置于竞争性游戏环境中来评估大语言模型代码生成能力的创新框架,旨在揭示静态基准测试分数与实际动态性能之间的显著差异,从而倡导更丰富的、基于竞争的评估方法。

原作者: Wenjun Peng, Xinyu Wang, Qi Wu

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenjun Peng, Xinyu Wang, Qi Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一支厨师团队来烹饪一顿饭。目前,我们测试这些厨师(它们代表 AI 语言模型)的方法是给他们一份食谱,然后问:“你遵循指令了吗?”如果他们端出的菜肴看起来和书上的图片一模一样,我们就给他们合格的分数。这就像是目前用于测试 AI 代码生成器的“静态基准测试”(static benchmarks)。

但问题在于,仅仅因为厨师遵循了食谱,并不意味着食物真的好喝,也不意味着他们做得足够快,或者在烤箱坏掉或顾客退菜时能应对自如。

ProxyWar 是一种测试这些 AI 厨师的新方法。它不再仅仅检查厨师是否遵循了食谱,而是将他们置于一个竞争性的厨房竞技场中,让他们与其他 AI 实时进行对决。

以下是论文如何使用简单的概念来解释这个新框架的:

1. 竞技场:一个游戏版图

与其设置一个安静的测试厨房,ProxyWar 设置了一个游戏版图。AI 模型被要求编写代码来创建一个“玩家”(智能体),去玩各种游戏,比如数独、井字棋或扑克。

  • 设置: AI 被给予游戏的规则,并被要求为一名玩家编写代码。
  • 转折: 这不仅仅是为了玩游戏;而是要比其他的 AI 玩家玩得更好。

2. 三轮测试

论文描述了一个三步走的过程,旨在观察 AI 是否真的优秀,而不仅仅是运气好:

  • 第一轮:安全检查(单元测试)
    在游戏开始之前,代码会被检查是否会导致崩溃。厨师有没有记得打开炉灶?代码结构是否正确?如果代码在此阶段失败,它会被发回给 AI 并附带一条说明:“修复此错误”,然后 AI 会再次尝试。这测试了 AI 的**自我调试(debug)**能力。
  • ** 第二轮:锦标赛(战斗)**
    一旦代码通过了安全检查,AI 玩家就会被投入竞技场。他们会与其他 AI 进行面对面的对决。
    • 为什么这很重要: 在普通的测试中,两个 AI 可能都因为都遵守了规则而同时“通过”。但在竞技场中,其中一个可能动作缓慢、在游戏变得困难时犯傻,或者被棘手的对手搞糊涂。ProxyWar 衡量的是谁真正赢得了比赛,而不仅仅是谁遵守了规则。
  • 第三轮:计分板(TrueSkill)
    系统没有使用简单的“通过/失败”,而是使用了一种排名系统(类似于电子游戏中的等级),为每个 AI 赋予一个技能评分。这个评分不仅告诉我们代码是否有效,还告诉我们它与其他人相比有多高效、稳定且聪明

3. 他们的发现

研究人员使用这种新方法测试了许多不同的 AI 模型(包括一些由大科技公司开发和一些开源的模型)。他们发现了一些旧测试所忽略的惊人现象:

  • “快而蠢” vs. “慢而聪明”的陷阱: 一些 AI 编写的代码在理论上是完美的,但由于思考时间过长,导致速度太慢,最终输掉了比赛。旧的测试会说:“做得好,完美的代码!”但 ProxyWar 会说:“你输了,因为你太慢了。”
  • 专家 vs. 通才: 一些 AI 擅长编写简单任务的代码,但当游戏变得复杂或棘手时就会崩溃。另一些 AI 擅长策略,但在修复自己的错误方面表现不佳。
  • “记忆化”问题: 一些 AI 似乎记住了简单谜题的答案。但当游戏发生轻微变化,或者必须面对棘手的对手时,这些记忆中的答案就失效了。ProxyWar 暴露了这一弱点,因为这些游戏是动态且不可预测的。

大局观

论文认为,我们不能仅仅问 AI:“你能写出通过测试的代码吗?”我们需要问:“你能写出在混乱、竞争激烈的现实世界中生存并获胜的代码吗?”

ProxyWar 就像是一个代码的角斗士竞技场。它不仅检查代码是否存活,还检查代码是否足够强韧、快速且聪明,足以击败竞争对手。作者们相信,这为我们提供了更清晰的视角,让我们了解哪些 AI 真正准备好迎接现实世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →