Rethinking the Evaluation of Harness Evolution for Agents
本文通过论证在相同预算且针对留出任务进行公平比较时,自动化工具链演进(harness evolution)并不能提供一致的性能提升且表现出有限的泛化能力,从而对当前针对大语言模型智能体自动工具链演进的评估协议提出了批判。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人助手(一个 AI 智能体)需要解决复杂的计算机谜题。为了帮助它,你给它一个“吊架”(harness)——一套精巧的指令、工具和规则,告诉机器人如何与计算机对话、按下哪些按钮以及如何检查自己的工作。
一段时间以来,研究人员一直认为,让这些机器人变得更强大的最佳方法是构建一个“机器人机械师”,它可以自动调整并升级这个吊架。这个机械师会观察机器人的失败,思考“嗯,如果我改变这条规则会怎样?”,然后尝试一个新的吊架,并不断重复,直到找到完美的设置。他们称之为自动吊架进化(Automatic Harness Evolution)。
但在这一篇新论文中,一组研究人员决定重新审视这个“机器人机械师”究竟是在做实事,还是仅仅在愚弄我们。他们设置了一场公平的比赛,以观察这个机械师是真的在设计更好的工具,还是仅仅通过尝试大量的猜测来碰运气。
大赛:进化 vs. 仅仅是努力尝试
研究人员在名为 Terminal-Bench 2.1 的著名谜题集上设置了一场竞赛,该集合包含 89 个不同的终端任务。他们使用了目前最智能的三种 AI 模型:Claude Opus 4.6、GPT-5.4 和 GPT-5.4 mini。
他们比较了四种不同的策略,所有策略都被给予了完全相同的“思考时间”(计算预算):
- 并行采样(Parallel Sampling): 想象一下同时让机器人尝试解决这个谜题 5 次,然后挑选出最好的答案。这就像掷 5 次骰子并希望得到一个六点。
- 顺序精炼(Sequential Refinement): 想象机器人尝试一次,看到哪里出错,修正其思考过程,然后再次尝试。这就像修改文章草稿。
- 吊架进化(Harness Evolution): 这是“机器人机械师”。它根据过去的失败尝试重写机器人的指令手册,希望能为所有人创造一个更好的工具。
- 吊架缩放(Harness Scaling): 这就像机械师在机器人尝试解决这个特定谜题的过程中,专门为这个特定的谜题重写指令。
令人震惊的结果
研究发现,“机器人机械师”(吊架进化)并没有在比赛中持续获胜。事实上,它经常输给那些更简单的方法。
当没有“答案钥匙”(单元测试)时:
如果机器人必须靠自己来判断对错,那么“机器人机械师”实际上让情况变得更糟了。
- 简单的“尝试 5 次”方法(并行采样)将平均分从 68.2 提升到了 72.3。
- “机器人机械师”(吊架进化)仅达到了 67.4,这甚至比直接使用原始指令而不做任何改动还要低!
- 作者认为,在没有明确的“答案钥匙”来告诉机器人什么是正确的情况下,机械师制造了一些嘈杂且令人困惑的变化,反而损害了机器人的表现。
当有“答案钥匙”(单元测试)时:
即使机器人可以根据完美解法来检查自己的工作,机械师依然没有脱颖而出。
- “尝试 5 次”的方法达到了 86.0 的平均分。
- “机器人机械师”仅达到了 75.8。
- 作者注意到了一些奇怪的现象:只有当允许选择 5 次尝试中的最佳结果(pass@5)时,机械师的改进才会显现。当要求在第一次尝试时就必须做对(pass@1)时,机械师几乎没有任何改进。这表明机械师并不是在设计更好的工具,而是在帮助机器人进行更多的猜测。
“过拟合”陷阱
最大的惊喜出现在研究人员测试“机器人机械师”是否能学到适用于新谜题的经验时。他们让机械师在 45 个训练任务上进行练习,然后在 34 个它从未见过的全新任务上进行测试。
结果是,机械师几乎没有产生任何实质性的推动作用。
- 在新的任务上,平均得分仅上升了 0.6 分。
- 对于其中一个模型(GPT-5.4),得分完全没有变化(从 72.1 到 72.1)。
论文指出,机械师并没有学习成为优秀机器人的通用规则。相反,它是在“背诵针对特定谜题的捷径”。这就像一个学生背诵了练习题的答案,但在真正的考试中却不及格,因为他并没有真正掌握学科知识。
那么,结论是什么?
该论文认为,我们不应该仅仅因为“吊架进化”在它练习过的相同谜题上得分更高,就将其视为灵丹妙药。
- 它排除了: 它排除了这些进化方法目前优于单纯通过增加尝试次数(扩展测试时计算量)的观点。
- 它暗示了: 它暗示我们看到的收益可能只是机器人尝试更多次数的结果,而不是因为吊架设计变得更聪明了。
- 核心启示: 作者提出,要让吊架进化真正发挥作用,我们需要在需要真正升级工具的难题上进行测试,并且必须在新谜题上进行测试,以确保它不是通过背诵旧题来作弊。
简而言之,“机器人机械师”仍处于开发阶段。目前看来,它更擅长针对单个谜题微调指令,而不是发明一种适用于所有人的通用工具。论文建议,在宣布这种方法获胜之前,我们需要更公平的测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。