Evo-Bench: Can Language Models Improve Agent Harness?
本文介绍了 Evo-Bench,这是首个旨在隔离并评估语言模型自主演进其操作框架之内在能力的基准测试,该研究揭示了显著的性能提升和可迁移的推理结构,同时也强调了在需要高度特定工作流的任务中所面临的领域特定挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你刚刚构建了一个超级聪明的机器人大脑。它能阅读、写作,并能比几乎所有人都要更好地解决难题。但有一个限制:这个大脑就像一个才华横溢却笨手笨脚的厨师。它拥有所有的食材(知识),但没有食谱(指令)来教它如何真正烹饪出一道菜。在人工智能的世界里,这个“食谱”被称为智能体架构(agent harness)。它是规则、工具和工作流的集合,告诉 AI 如何利用它的头脑去完成任务——比如如何搜索网页、编辑电子表格或撰写报告。
长期以来,人类一直是这些食谱的编写者,通过仔细微调使 AI 工作得更好。但如果 AI 能自己编写自己的食谱呢?如果不再是我们告诉它如何修正错误,而是让 AI 观察自己的失败,弄清楚哪里出了问题,然后重写自己的指令以变得更聪明呢?这就是科学家们正在追问的大问题:AI 真的可以教导自己如何成为一名更好的工作者,还是它仍然需要人类牵着它的手?这篇论文深入探讨了这个谜团,测试了 AI 是否可以进化出属于自己的“操作系统”,从而成为自身命运的主宰。
AI 自我进化大实验
认识一下 Evo-Bench,这是第一个专门设计用于测试 AI 是否能升级其自身软件的“健身房”。把它想象成一款电子游戏,其中的角色不仅是通过获得经验值来升级;相反,该角色被允许重写自己的代码以变得更强大。研究人员建立了一个受控环境,其中包含三种不同类型的“任务”:搜索(在网上寻找信息)、办公(管理复杂的文档和电子表格)以及通用(处理各种棘手的、开放式任务)。
在这次实验中,他们给各种 AI 模型提供了一套基础且简单的指令(“种子架构”)以及严格的时间和计算能力预算。AI 的任务是扮演一名自主工程师的角色:观察自己在哪里失败了,猜测原因,然后重写自己的代码来修复它。他们并没有让 AI 瞎猜;他们要求 AI 在面对最终的、秘密的“评估”集之前,必须先在“验证”任务集上证明自己的改进是有效的。这确保了 AI 不仅仅是在死记硬背答案,而是在真正学习如何构建更好的工具。
结果:天才与故障并存的复杂局面
实验结果是一场高潮与低谷交织的旅程。表现最好的 AI 模型,如 GPT-5.6 Sol 和 Claude Opus 4.8,证明了它们确实可以学会自我提升。它们成功地在初始水平的基础上实现了高达 16.6 分 的巨大飞跃,非常接近那些由人类花费数年时间手工工程构建的系统水平。
然而,故事并非简单的“AI 获胜”。论文发现,AI 的自我提升能力很大程度上取决于它正在尝试做的是什么:
- 搜索任务: AI 在这里表现得像个超级明星。它学会了如何导航网页并清理杂乱的数据,其表现几乎可以媲美人类专家。
- 通用任务: 在这些广泛且具有创造性的挑战中,AI 实际上超越了人类设计的系统。它发明了人类尚未想到的全新思维方式。
- 办公任务: 这是 AI 的弱点。当工作需要非常具体、僵化的工作流时(例如处理复杂的电子表格),AI 就显得力不从心。它无法理清所需的精确步骤,经常陷入停滞或出现细小、重复性的错误。
“早期饱和”陷阱
论文中最有趣的发现之一是作者称之为**“早期饱和(early saturation)”**的现象。想象一个正在考试的学生。他们努力学习,第一次尝试就拿到了高分,然后决定继续学习。但他们不仅没有变得更好,反而开始过度思考,不小心把原本正确的答案搞砸了。论文表明,许多 AI 模型很快就会达到一个“甜点区(sweet spot)”,找到一个很好的解决方案,但随后在后续轮次中不断进行修补,反而破坏了原本行之有效的方案。他们在找到一个真正完美的系统之前,就耗尽了时间或耐心。
天才的代价
论文还研究了这种自我进化的代价。事实证明,获得最佳结果是非常昂贵的。表现最好的 AI 在整个实验过程中花费了超过 500 美元,而其他模型则在不到 40 美元 的成本下取得了不错的结果。这表明存在一个“帕累托前沿(Pareto frontier)”——即一条权衡曲线,如果你想要获得最后那几分完美的提升,就必须投入大量的资金。
总结
那么,语言模型可以改进它们自己的智能体架构吗?可以,但有限制。 论文显示,对于开放式和重搜索型的任务,AI 越来越擅长重新发明自己,有时甚至能击败人类工程师。但对于需要僵化、特定程序的任务,它仍然需要人类的手来引导。研究人员得出结论:虽然我们正看到真正的 AI 自我进化初现曙光,但我们还没有完全到达那里。目前的 AI 就像一个聪明的学徒,他可以发明一种新的烹饪技巧,但仍需要一位大师级厨师来告诉他究竟该如何切洋葱。这个全新的基准测试 Evo-Bench 为我们提供了一张清晰的地图,标示出 AI 今天的现状以及明天需要走向何方。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。