← 最新论文
🤖 machine learning

TTHE: Test-Time Harness Evolution

本文介绍了测试时控制程序演化(Test-Time Harness Evolution, TTHE),这是一个无监督框架,通过基于执行轨迹演化候选控制程序种群,在评估过程中动态优化 LLM 智能体的可执行控制程序,从而实现在无需更新模型权重或需要地面真值标签的情况下,对测试时分布进行持续适应。

原作者: Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian, Bo Han

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian, Bo Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人助手(一个 LLM 智能体),它能编写代码、解决数学问题或为你预订机票。通常,当我们构建这些机器人时,我们会花费数周时间对其进行训练,然后“冻结”它们的大脑。一旦大脑被冻结,我们就无法改变其内部的线路。如果它们犯了错,我们不能直接告诉它们:“嘿,下次试着换种思考方式。”

但如果机器人的“指令”——即那个告诉它如何使用大脑的小程序——可以即时发生变化呢?这就是一种被称为**测试时挂架进化(Test-Time Harness Evolution, TTHE)**的新方法背后的核心理念。

“冻结的大脑,灵活的外套”类比

把机器人的大脑想象成一座冻结的雕像。你无法融化它或重塑它。但机器人穿着一件高科技外套(即挂架/harness)。这件外套里有工具口袋、一份步骤清单,以及一种检查机器人是否犯错的方法。

大多数机器人穿着的是静态外套。一旦机器人离开工厂,外套就被缝死了。如果机器人尝试开门失败了,外套并不知道下次该如何修复这个问题。它只会不断重复那种出错的方式。

TTHE 就像是一件可以在机器人工作时自行改写缝纫说明的外套。

以下是它在实际应用中是如何运作的:

  1. 机器人尝试: 机器人尝试执行一项任务(比如编写 SQL 查询或修复 Bug)。它会留下一些“面包屑”(即执行轨迹/execution trace),展示它具体做了什么、使用了哪些工具以及在哪里跌跤了。
  2. 外套读取面包屑: 外套的一个特殊部分(提议者/Proposer)会观察这些面包屑。它不需要老师,也不需要正确答案。它只是在问:“嗯,机器人尝试打开门,但把手生锈了。也许下次,我们应该先给把手涂点油?”
  3. 外套自我改写: 提议者修改外套的代码。它可能会增加一个检查生锈的步骤,或者增加一条双重检查把手的规则。
  4. 外套挑选最佳版本: 外套的另一个部分(评判者/Judge)会观察所有新版本的外套,并根据机器人自身的表现选出看起来效果最好的那一个。
  5. 机器人继续前进: 机器人带着这件改进后的、更好的外套继续进行下一项任务。

这种方法“不”做什么

了解该方法拒绝的内容非常重要:

  • 不做脑部手术: 论文明确指出,他们没有改变机器人冻结的大脑(模型权重)。他们没有重新训练 AI。他们只改变外套(挂架)。
  • 不需要神奇的答案钥匙: 在机器人学习的过程中,他们没有使用“金标准标签”(正确答案)。机器人必须通过观察自己的错误和成功来自己摸索出哪些方法有效。
  • 不是预先规划: 他们不会在机器人开始工作之前就去寻找完美的套件。外套是在工作过程中进化的。

结果:效果如何?

研究人员在一些极具挑战性的任务上测试了它,比如编写数据库查询、竞技编程和修复软件漏洞。他们将“静态外套”机器人与“进化外套”机器人进行了对比。

以下是他们的发现(使用测试中的准确数字):

  • Text-to-SQL (BIRD): 基准机器人正确率为 12.0%。使用 TTHE 后,它跃升至 50.0%。这是一个巨大的进步!
  • 竞技编程 (LiveCodeBench):30.0% 提升到了 38.3%
  • 软件工程 (SWE-bench):20.0% 提升到了 35.0%
  • 数据科学 (DS-1000):38.0% 提升到了 44.0%

他们甚至在名为 claw-eval 的工具使用任务上进行了测试,该任务的分数形式略有不同(分数为 0 到 1 之间的等级)。得分从 48.9% 提升到了 69.8%

缺陷:它并不完美

论文非常诚实地指出了该方法遇到的瓶颈。“评判者”在挑选最佳外套时并非完美无缺。有时,“评判者”选出的外套看起来不错,但实际上在隐藏测试中失败了。

  • 选择遗憾 (Selection Regret): 在一项测试中,如果“评判者”能从它看到的候选外套中选出最好的那件,它本可以达到 64.0% 的准确率。但由于“评判者”犯了错,选了一个稍差的版本,最终只得到了 50.0%
  • 覆盖差距 (Coverage Gap): 即使“评评判者”是完美的,仍有一些任务(在一次测试中约为 50 个任务中的 15 个)是没有任何一件外套能够解决的。机器人当时还没有具备相应的工具或思路。

总结

作者认为,测试时挂架进化是一种无需触动大脑即可让 AI 智能体变得更聪明的高效方法。它将机器人的工作日志变成了它的老师。

然而,他们也警告说,这还不是一个“已解决的问题”。该方法高度依赖于“评判者”能否分辨出什么是“运气好猜对的”以及什么是“真正的解决方案”。如果“评判者”被棘手的测试搞糊涂了,机器人可能会学到错误的教训。但就目前而言,它表明,给 AI 一件能在工作时自我修复的外套是一个非常有前景的方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →