← 最新论文
🤖 AI

AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

本文介绍了 AgentLens,该框架通过证明仅依赖二元测试结果会掩盖解决方案质量方面的显著差异,揭示了 SWE-agent 评估中“幸运通过”现象的普遍性,并提出了一种利用任务级前缀树接受器参考进行流程级评估的方法,以更准确地对模型性能进行排序。

原作者: Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一名机械师来修理你的汽车。目前我们测试人工智能软件工程师(称为"SWE 代理”)的方式非常简单:你交给他们一辆坏掉的车,他们带回一辆修好的车,然后你检查它是否能启动。如果能启动,你就给他们一颗金星;如果不能,就给他们一个红叉。

这就是“通过/失败”系统。根据这篇论文,问题在于该系统将两种截然不同的机械师完全等同对待:

  1. 大师级机械师:迅速诊断问题,订购正确的零件,高效修复,并双重检查工作。
  2. 幸运赌徒:尝试 50 个随机零件,盲目更换,途中弄坏了一些其他部件,感到沮丧,最终——纯粹靠运气——碰巧装上了正确的零件。汽车启动了。

在旧系统下,两人都获得金星。但论文认为这是一个错误。“幸运赌徒”实际上是一个糟糕的雇佣对象,因为他们的过程混乱、浪费且不可预测。

问题:“幸运通过”

研究人员分析了人工智能代理修复真实软件错误的 2,600 多次尝试。他们发现,10.7% 的“成功”修复实际上是“幸运通过”。

这些代理并非逻辑地解决问题。相反,他们:

  • 盲目重试:就像一个孩子不停地敲击钢琴,直到奏出正确的乐曲。
  • 忘记检查:修复了代码,但从未运行测试以确认其是否真正有效。
  • 浪费时间:探索了错误的文件,或在找到答案前兜圈子。

解决方案:AGENTLENS(“过程摄像机”)

为了解决这个问题,团队开发了一种名为AGENTLENS的新工具。把它想象成一台高清摄像机,它不仅观察成品汽车,还会以慢动作记录整个维修过程

AGENTLENS 主要做两件事:

1. “优质解决方案地图”(PTA)
AGENTLENS 不是将人工智能的工作与单一的“完美”示例进行比较,而是构建了一个前缀树接受器(PTA)

  • 类比:想象一棵树,树干代表工作的开始。树枝代表修复汽车的不同有效方式。有些树枝经过引擎室,另一些则经过后备箱。
  • 如果人工智能走的是树上存在的路线,说明它做得聪明;如果它偏离树木进入森林,就是在浪费时间。

2. “意图翻译器”
该工具观察人工智能的所作所为,并为每一步标记一个“想法”:

  • 探索:“我正在寻找问题。”
  • 实施:“我正在修复部件。”
  • 验证:“我正在检查它是否有效。”
  • 编排:“我正在整理我的思路。”

如果人工智能在编写代码之前就运行测试,该工具会将其标记为困惑。如果它修复了代码但从未运行测试,则将其标记为有风险。

他们的发现

当他们将这种新的“过程摄像机”应用于数据时,结果令人惊讶:

  • 并非所有获胜者都平等:他们将成功的修复分为三组:
    • 理想型(20%):干净、逻辑清晰且高效。
    • 稳健型(69%):良好,但可能略显杂乱。
    • 幸运型(10.7%):“赌徒”群体。他们得到了正确的答案,但过程混乱。
  • 排名发生了变化:当他们根据人工智能如何解决问题(而不仅仅是是否解决了问题)对模型进行排名时,排行榜发生了翻转。
    • 一个模型(GPT-4o)从第 8 名跃升至第 3 名,因为当它确实成功时,其过程非常干净。
    • 另一个模型(Opus 4.6)从第 1 名跌至第 6 名。它的成功率很高,但其中许多胜利都是充满浪费努力的“幸运通过”。
  • 幸运的成本:“幸运”代理的成本极高。有些代理为了获得相同的结果,浪费了高达40 倍的计算资源(token)。这就像因为不知道如何使用胡桃夹子,而用大锤去砸开坚果。

“幸运”的五种类型

论文还具体分类了这些代理是如何“幸运”的:

  1. 过度自信者:修复了问题,但没有检查是否有效。
  2. 蛮力者:不断尝试随机事物,直到有一个奏效。
  3. 半途而废者:只解决了问题的一部分,但测试不够严格,未能发现其余部分。
  4. 漫游者:在探索中迷失,从未真正专注。
  5. 创意天才:找到了一种完全不同的、有效的修复方法,这是“地图”未曾预料到的(这是唯一一种“好”的幸运)。

核心结论

论文总结道,我们不能只问人工智能:“你修好了吗?”我们必须问:“你以正确的方式修好了吗?”

通过使用AGENTLENS,我们可以停止奖励那些靠运气或浪费的人工智能模型。相反,我们可以训练它们像大师级机械师一样:高效、逻辑清晰且可靠。研究人员已发布了他们的工具和数据,以便其他人开始使用这种“过程摄像机”来更好地评估人工智能工程师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →