← 最新论文
🤖 AI

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

本文介绍了 HarnessOpt-Bench,这是一个旨在评估前沿大语言模型在资源约束下迭代优化智能体架构(包括提示词、工具和编排代码)能力的全新基准测试,该研究表明这种优化能力是一种独特且可衡量的技能,并且仍有巨大的提升空间。

原作者: Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个天才、超级聪明的机器人大脑。它能编写代码、解决数学问题并回答问题。但这个大脑并非在真空中运作;它需要一个“护具”(harness)。把护具想象成机器人的盔甲、它的说明书以及它的控制面板,所有这些都融合在了一起。它是代码,告诉大脑如何使用它的工具、要记住什么,以及如何与外界交流。就像赛车需要优秀的驾驶员调校精良的引擎才能获胜一样,聪明的 AI 需要聪明的脑子一个出色的护具才能表现出色。有时,同一个大脑在一种盔甲下是天才,而在另一种盔甲下却是笨拙的新手。

这里有一个大问题:我们能否教会 AI 去修理它自己的护具?一个 AI 能否观察它自己的护具,意识到它很笨重,然后重写代码让它自己变得更聪明?这被称为“护具优化”(harness optimization)。这有点像要求一位厨师不仅要烹饪美食,还要在烹饪的同时重新设计厨房、磨利刀具并改写食谱,而且在最后结束之前,他并不知道评委最终会如何品尝这道菜。这是一个巨大的挑战,因为修理护具既昂贵又棘手:你必须在看不见最终得分的情况下猜测什么才有效,而且你必须在耗尽“能量”(在这种情况下是计算时间和金钱)之前完成任务。

这正是 Scale AI 的研究人员试图通过一个名为 HarnessOpt-Bench 的新实验来测试的任务。他们建立了一个特殊的、安全的游乐场,让不同的顶尖 AI 模型充当“优化器”。它们的工作任务是:接手一个基础的、略显笨拙的 AI 智能体(“种子”),阅读它的代码,并尝试改进它。限制条件是,优化器有一个严格的预算:它只能运行有限次数的测试来观察其改动是否奏效。它会从一些测试运行(开发和验证)中获得提示,但最终的真实得分直到它提交其最完美的版本时才会揭晓。

研究人员想看看这些 AI 模型是否真的能更好地完成这项任务。他们进行了 111 场不同的实验,使用了目前最强大的五种 AI 模型,并以两种方式进行测试:一次是使用标准的、共享的“工具包”(一个通用的编码护具),另一次是使用它们各自原生的、内置的工具包。他们通过衡量 AI 在多大程度上改进了智能体的性能(相对于原始的笨拙版本)来衡量成功。

以下是他们的发现,这有点令人惊讶。首先,AI 模型本身的重要性远大于它们所使用的工具包。最聪明的 AI 与最不聪明的 AI 之间的性能差异巨大——几乎是由于更换工具包所导致的差异的两倍。这表明“大脑”才是真正的明星,而不是它所穿着的“盔甲”。

其次,拥有一个华丽的原生工具包并不保证能获胜。你可能会认为 AI 会在自己定制的工具下表现最好,但结果却褒贬不一。有时原生工具包有帮助,有时没有,有时标准工具包反而更好。不存在一致的“主场优势”。

第三,AI 寻找解决方案的方式至关重要。那些尝试对代码中更多部分进行微调(例如提示词、记忆、重试规则和工具)的 AI 往往能获得更好的结果。然而,这些 AI 并没有花太多时间去阅读详细的“失败报告”(追踪记录)来了解哪里出了错。它们主要关注最终得分。这表明,对于这些任务,观察大局比纠结于每一个微小的错误更有用。

最后,AI 往往过于乐观。它们在搜索过程中看到的得分(在“练习”测试中)通常高于它们在最终隐藏测试中的得分。这意味着 AI 有时认为自己找到了完美的解决方案,但当真正的评委看到它时,效果其实并没有那么好。

简而言之,这篇论文表明,护具优化是前沿 AI 模型所具备的一种真实且可衡量的技能,但它们仍在学习如何稳定地做到这一点。最好的模型可以显著提高智能体的性能,但它们还并不完美。它们需要学会不再那么过度自信,并且也许应该更仔细地阅读失败报告。其核心启示是:我们正在迈向一个 AI 不仅能执行任务,还能学习构建更好版本的自己的未来,但在它们能够无需人类帮助就能可靠地做到这一点之前,我们还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →