← 最新论文
🤖 AI

Stop Comparing LLM Agents Without Disclosing the Harness

本立场论文主张,对于长程任务而言,智能体执行框架往往是比底层语言模型更关键的性能决定因素,并呼吁社区采用框架感知评估协议,以防止将基础设施带来的增益系统性地错误归因于模型改进。

原作者: Yunbei Zhang, Janet Wang, Yingqiang Ge, Weijie Xu, Jihun Hamm, Chandan K. Reddy

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunbei Zhang, Janet Wang, Yingqiang Ge, Weijie Xu, Jihun Hamm, Chandan K. Reddy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和创意类比对该论文的解读。

核心理念:重要的不只是引擎,而是整车

想象一下,你正在评判哪款汽车引擎最好。你把一台法拉利引擎装进了一辆生锈、破败、轮胎漏气且方向盘失灵的旧轿车里。然后,你把一台稍弱一点的引擎装进了一辆崭新、高科技、轮胎完美且配有 GPS 导航系统的赛车里。

如果第二辆车赢了比赛,是因为引擎更好吗?不是。 它赢是因为“整车”(底盘、轮胎、导航系统)更好。

这篇论文指出,我们在人工智能(AI)领域目前正犯着完全相同的错误。

当我们测试 AI“智能体”(能够执行编写代码或修复软件漏洞等任务的 AI 程序)时,我们通常只看一个分数,然后说:“哇,模型 A 比模型 B 好。”作者认为这是误导性的。他们主张,对于复杂、长期的任务,分数更多地取决于“ harness(驾驭系统/软件基础设施)”——即围绕 AI 的软件架构,而不是 AI 模型本身。

"Harness":AI 的身体与神经系统

论文将这种基础设施称为"Harness(驾驭系统)"。把 AI 模型(“大脑”)想象成一名飞行员。Harness 则是驾驶舱、自动驾驶系统、燃油表和通讯无线电。

  • 模型(大脑): 它只是负责思考和生成文本的部分。它是“开环”的,意味着它只是抛出答案并等待下一个提示。除非有人告诉它,否则它不知道自己是否犯了错。
  • Harness(控制器): 这是软件层,负责:
    • 决定向 AI 展示哪些信息(上下文)。
    • 检查 AI 的答案是否合理(验证)。
    • 如果 AI 失败,指示其重试(重试逻辑)。
    • 防止 AI 因信息过载而困惑(内存管理)。

论文声称,对于漫长且困难的任务,Harness 是“绑定约束”(binding constraint)。 这意味着 Harness 是瓶颈。如果 Harness 很差,即使是最聪明的 AI 也会失败。如果 Harness 很棒,稍逊一筹的 AI 也能成功。

“绑定约束论题”

作者提出了一个名为**绑定约束论题(Binding Constraint Thesis)**的理论。用通俗的话来说,它的意思是:

“当我们在困难、长期的任务上比较顶级 AI 模型时,它们分数的差异更多是由 Harness 的构建方式决定的,而不是由所使用的模型决定的。”

他们发现,改变 Harness 可以使分数波动15 个百分点,而改变模型通常只能使分数变动2 到 4 分

类比: 想象两名跑步者。一名是奥运短跑运动员(模型 A),另一名是非常健壮的业余选手(模型 B)。

  • 如果你让奥运短跑运动员穿上泥泞的靴子并背着重背包(糟糕的 Harness),他们可能会输给穿着完美跑鞋的业余选手(优秀的 Harness)。
  • 论文指出,当前的排行榜就像一场每个人穿着不同鞋子比赛,但我们只报告谁赢了,却忽略了鞋子。

为什么当前的排行榜是“不完整”的

目前,基准测试(如 SWE-bench 或 Terminal-Bench)表现得好像它们只是在测试“大脑”一样。但在现实中,它们测试的是大脑 + Harness

由于研究人员很少公布他们是如何构建 Harness 的(驾驶舱的“配方”),我们无法判断一个模型是否真的更聪明,还是团队只是围绕它构建了更好的 Harness。

论文的证据:

  1. 现实案例: 他们展示了同一个 AI 模型(Claude Opus)在使用一种 Harness 时得分为 45.9%,而在使用另一种 Harness 时得分为 55.4%。仅仅通过改变软件包装(而非模型),分数就出现了巨大飞跃。
  2. 受控实验: 他们选取了三个不同的顶级模型,并让它们通过三种不同的 Harness(最小化、改进型和完整型)运行。
    • 结果: 改变 Harness 对分数的影响远大于改变模型。
    • 转折: 有时,拥有“更好”Harness 的“较差”模型,击败了拥有“较差”Harness 的“更好”模型。排名发生了反转!

解决方案:“披露”与“方差分解”

论文并非主张停止使用模型。它主张我们不能再假装 Harness 不存在。他们提出了一种评估 AI 的新方法:

  1. "Harness 卡片”: 就像食品标签列出成分一样,每个 AI 基准测试提交都应列出其"Harness 卡片”。这张卡片详细说明了上下文是如何构建的、错误是如何处理的,以及 AI 是如何被验证的。
  2. 方差分解: 研究人员不应只给出一个分数,而应报告:
    • 分数差异中有多少归因于模型
    • 有多少归因于Harness
    • 有多少归因于两者之间的交互

结语

如果你是一位研究人员、投资者或正在查看 AI 排行榜的用户,论文警告你:不要盲目信任排名。

在我们看到"Harness 卡片”之前,排行榜的排名就像是在不知道谁驾驶哪辆车的情况下评判一场比赛。“获胜者”可能只是拥有一辆更好的车,而不是更好的司机。要真正理解 AI 的进步,我们需要停止仅比较“大脑”,转而比较整个系统——即大脑及其所栖身的“身体”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →