← 最新论文
💬 NLP

Self-Harness: Harnesses That Improve Themselves

本文介绍了 Self-Harness,这是一种全新的范式,其中基于大语言模型(LLM)的智能体能够迭代地识别自身的失败模式,并自主生成、验证及实现特定于模型的约束机制(harness)修改,从而在无需人工干预的情况下显著提升性能。

原作者: Hangfan Zhang, Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Hangfan Zhang, Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位才华横溢的新员工(即 AI 模型),他非常聪明,但从未见过你具体的办公室。你给他布置了一项工作,但他却不断犯同样的低级错误:他忘记保存工作进度,或者陷入无休止的求助循环,或者误解了你的文件归档系统。

通常情况下,人类经理必须坐下来,看着员工失败,然后手动重写员工的“规则手册”(即 harness/约束机制)来解决这些问题。这非常耗时,而且如果你明天雇佣了另一种类型的员工,你又必须重新编写规则手册,因为他们的习惯不同。

Self-Harness 是一个全新的想法,即让员工自己修复自己的规则手册。

以下是该论文对这一概念的解释,使用了简单的类比:

三步“自我改进”循环

论文描述了一个过程,让 AI 扮演自己的经理,通过三个不同的阶段进行自我改进,而无需人类帮助或“更高级”的 AI 老板。

1. 弱点挖掘(侦探)
AI 不仅仅是观察一个错误,它会运行一系列任务,并收集一堆“犯罪现场报告”(失败的尝试)。它将这些失败案例进行归类。

  • 类比: 想象 AI 注意到:“嘿,我之所以在三个不同的任务中失败,都是因为我在分心之前忘记保存文件了。”它不仅仅是说“我失败了”;它识别出了一个特定的失败模式

2. 约束提案(建筑师)
基于这些模式,AI 会建议对其自身规则手册进行微小的、针对性的修改。

  • 类比: AI 说:“好吧,我知道我总是忘记保存。让我们在我的指令手册中添加一条小规则:‘在开始新任务之前,你必须保存当前的工作内容。’”
  • 至关重要的一点是,AI 并不会重写整个手册。它只进行解决特定问题所需的最小、最精准的修改。它会提出几种不同的方案,以观察哪一个效果最好。

3. 提案验证(严厉的法官)
这是最重要的安全步骤。AI 会在一组它从未见过的任务上测试它的新规则手册。

  • 类比: 把这想象成一次“回归测试”。AI 会问:“如果我遵循这条新规则,我是在原本擅长的任务上表现得更好了,还是修复了那些新的错误?”
  • 如果新规则导致 AI 在任何事情上的表现变差,该想法就会被拒绝。如果它在没有副作用的情况下提供了帮助,那么这条新规则就会被正式加入到规则手册中。

实验结果如何?

研究人员在三个非常不同的 AI 模型(MiniMax、Qwen 和 GLM)上测试了这一方法,使用的是一个名为 Terminal-Bench-2.0 的基准测试,这就像是一个 AI 必须使用电脑终端来解谜的游戏。

  • 起点: 他们给了这三个 AI 一个非常基础、极其简陋的规则手册。
  • 结果: 在运行了这个自我改进循环后,所有三个 AI 在解决谜题方面的能力都显著提升了。
    • 其中一个 AI 从解决约 40% 的任务提升到了 60% 以上。
    • 另一个从 23% 提升到了 38%。
    • 第三个从 42% 提升到了 57%。

“顿悟时刻”:不同的 AI 需要不同的修复方案

论文发现了一个非常有趣的现象:这种“修复方案”对每个人来说并不一样。因为 AI 的“个性”或思考方式不同,它们需要的规则手册修改也不同。

  • MiniMax 擅长探索,但不擅长收尾。修复方案是:制定一条“尽早创建最终文件”以及“如果你请求帮助次数过多,则停止循环”的规则。
  • Qwen 擅长开始,但经常不小心删掉自己的工作。修复方案是:制定一条“先检查依赖项”以及“除非确定,否则绝不删除文件”的规则。
  • GLM 容易陷入长时间的研究阶段,却从未真正动手构建。修复方案是:制定一条“在一定时间后从探索转向构建”的规则。

核心结论

论文得出结论,我们并不总是需要人类专家或“超智能”AI 来修复这些系统。如果我们给 AI 提供正确的工具,让它能够观察自身的失败,并赋予它只有在证明有效时才接受变更的纪律,它就可以进化出属于自己的操作系统

这就像是一个电子游戏角色,在死掉几次之后,摸索出了击败关卡的完美策略,然后为下一轮自动更新了自己的“攻略秘籍”,全程无需他人干预。论文表明,即使从一个非常简单的起点开始,这也是可以实现的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →