← 最新论文
💬 NLP

VeRO: An Evaluation Harness for Agents to Optimize Agents

本文提出了 VERO(版本、奖励与观测),这是一个包含可复现评估框架与基准测试套件的系统,旨在通过结构化追踪推理与执行结果,解决智能体优化任务中缺乏系统性评估的难题,并支持对编码智能体自我优化能力的实证研究。

原作者: Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan, Xue, Sam Denton

发布于 2026-02-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan, Xue, Sam Denton

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 VeRO 的新工具,它的核心任务非常有趣:让一个“程序员 AI"去自动优化另一个“任务 AI"的代码

为了让你更容易理解,我们可以把整个研究想象成一家高科技的“汽车改装与测试工厂”

1. 核心概念:VeRO 是什么?

想象一下,你有一辆正在跑赛车的目标汽车(这就是“目标 Agent",比如一个能帮你做数学题或查资料的 AI)。这辆车有时候跑得快,有时候会熄火,或者走错路。

以前,如果要改进这辆车,得靠人类工程师(程序员)去修修补补:看看哪里坏了,换个零件,再试一次。这很慢,而且很难标准化。

现在,VeRO 登场了。它就像是一个全自动的“改装车间”和“测试跑道”

  • 改装工(Optimizer Agent):这是一个会写代码的 AI,它的任务就是钻进车间,把目标汽车的引擎、轮胎、导航系统(也就是代码、提示词、工具)进行修改。
  • 测试跑道(Evaluation Harness):VeRO 提供了一条严格的测试跑道。改装工每改一次,车就必须跑一圈,系统会记录它跑得有多快、有没有翻车。
  • 黑匣子记录(Tracing):VeRO 会像行车记录仪一样,详细记录每一次修改前后的所有细节,确保这次改进是真的有效,而不是运气好。

2. 为什么需要 VeRO?(以前的痛点)

在 VeRO 出现之前,让 AI 自己优化自己就像让一个醉汉在黑暗中修钟表

  • 没有标准:有的 AI 改完代码,结果跑不通了,或者根本不知道它改了什么。
  • 乱花钱:AI 可能会为了改一点点东西,调用成千上万次昂贵的 API,就像为了换个螺丝把整个工厂烧了。
  • 不可复现:今天改好了,明天换个环境又坏了,因为没人记录当时的“配方”。

VeRO 解决了这些问题,它给 AI 改装工戴上了安全帽(限制权限,不能乱改核心文件)、预算表(只能改这么多次,不能无限试错)和行车记录仪(每一步改动都有据可查)。

3. 他们做了什么实验?(改装车间的实战)

研究人员在 VeRO 工厂里进行了三场大比赛:

比赛一:谁是最好的改装工?(基准测试)

他们找了 5 种不同类型的“目标汽车”(有的擅长做数学题,有的擅长查资料,有的擅长多步推理),然后让不同的“改装工 AI"去优化它们。

  • 发现:那些只懂改改说明书(提示词/Prompt) 的改装工,效果一般。
  • 发现:那些能真正动手改零件、换工具、调整引擎结构的改装工(VeRO 默认配置),效果最好。
  • 结论:想要 AI 变强,光改“说话的方式”不够,得改“干活的本事”(代码结构)。

比赛二:改装后的车,换个赛道还能跑吗?(鲁棒性测试)

他们把在“数学赛道”上改装好的车,拉到“科学赛道”或“工具使用赛道”上去跑。

  • 发现:有些改装是通用的(比如换了好轮胎,哪里都跑得快),但有些改装是特化的(比如为了跑数学赛道加了个计算器,结果去查资料反而变慢了)。
  • 结论:现在的 AI 改装工还不太擅长“举一反三”,它们容易为了一个任务把车改得太偏科。

比赛三:新手车 vs. 豪车(案例研究)

他们选了两辆车:

  • Pawn(新手车):配置很低,只有几个基础工具。
  • Knight(豪车):配置很高,有复杂的逻辑和很多工具。
  • 发现
    • 新手车潜力巨大,稍微改改就能飞起(因为底子薄,提升空间大)。
    • 豪车已经很强了,想再提升很难,而且如果改装工给太多“指导书”(复杂的指令),反而会把豪车改得笨手笨脚。
    • 有趣现象:对于豪车,有时候“少说话、多放手”(给改装工更少的指令,让它自由发挥)效果反而更好。

4. 他们发现了什么大秘密?

  1. 提示词不是万能药:现在的 AI 改装工太懒了,它们 90% 的时间都在改“提示词”(就像只改汽车说明书),而不敢去动真正的“代码结构”(引擎和传动系统)。VeRO 证明,动真格的改代码才能带来质的飞跃。
  2. 越复杂的车,越要小心:给一个已经很聪明的 AI 太多指令,反而会限制它的创造力;给一个笨笨的 AI 详细的“改装手册”,它反而能学会很多新技能。
  3. 没有免费的午餐:有时候为了在“数学题”上拿高分,AI 会加很多复杂的验证步骤,结果导致它在“查资料”时慢得像蜗牛。

5. 这对我们意味着什么?(总结)

这篇论文就像是在说:“我们终于造出了一个标准的实验室,让 AI 学会如何自己‘进化’。”

  • 以前:AI 优化靠人海战术,慢且乱。
  • 现在:有了 VeRO,我们可以系统地研究怎么让 AI 自己写代码、改代码,从而变得更聪明、更可靠。
  • 未来:虽然现在的 AI 改装工还像个“新手学徒”,经常改过头或者改偏科,但 VeRO 这个工具就像给它们提供了图纸、量尺和试车场。随着时间推移,我们有望看到 AI 能够自动设计出越来越强大的“超级助手”,甚至实现自我进化的良性循环。

一句话总结:VeRO 是给 AI 修车师傅们造的一个标准化、有监控、有预算的超级车间,让 AI 不仅能“干活”,还能学会“怎么把活儿干得更好”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →