Self-Harness: Harnesses That Improve Themselves
本文介绍了 Self-Harness,这是一种全新的范式,其中基于大语言模型(LLM)的智能体能够迭代地识别自身的失败模式,并自主生成、验证及实现特定于模型的约束机制(harness)修改,从而在无需人工干预的情况下显著提升性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你雇佣了一位才华横溢的新员工(即 AI 模型),他非常聪明,但从未见过你具体的办公室。你给他布置了一项工作,但他却不断犯同样的低级错误:他忘记保存工作进度,或者陷入无休止的求助循环,或者误解了你的文件归档系统。
通常情况下,人类经理必须坐下来,看着员工失败,然后手动重写员工的“规则手册”(即 harness/约束机制)来解决这些问题。这非常耗时,而且如果你明天雇佣了另一种类型的员工,你又必须重新编写规则手册,因为他们的习惯不同。
Self-Harness 是一个全新的想法,即让员工自己修复自己的规则手册。
以下是该论文对这一概念的解释,使用了简单的类比:
三步“自我改进”循环
论文描述了一个过程,让 AI 扮演自己的经理,通过三个不同的阶段进行自我改进,而无需人类帮助或“更高级”的 AI 老板。
1. 弱点挖掘(侦探)
AI 不仅仅是观察一个错误,它会运行一系列任务,并收集一堆“犯罪现场报告”(失败的尝试)。它将这些失败案例进行归类。
- 类比: 想象 AI 注意到:“嘿,我之所以在三个不同的任务中失败,都是因为我在分心之前忘记保存文件了。”它不仅仅是说“我失败了”;它识别出了一个特定的失败模式。
2. 约束提案(建筑师)
基于这些模式,AI 会建议对其自身规则手册进行微小的、针对性的修改。
- 类比: AI 说:“好吧,我知道我总是忘记保存。让我们在我的指令手册中添加一条小规则:‘在开始新任务之前,你必须保存当前的工作内容。’”
- 至关重要的一点是,AI 并不会重写整个手册。它只进行解决特定问题所需的最小、最精准的修改。它会提出几种不同的方案,以观察哪一个效果最好。
3. 提案验证(严厉的法官)
这是最重要的安全步骤。AI 会在一组它从未见过的新任务上测试它的新规则手册。
- 类比: 把这想象成一次“回归测试”。AI 会问:“如果我遵循这条新规则,我是在原本擅长的任务上表现得更好了,还是修复了那些新的错误?”
- 如果新规则导致 AI 在任何事情上的表现变差,该想法就会被拒绝。如果它在没有副作用的情况下提供了帮助,那么这条新规则就会被正式加入到规则手册中。
实验结果如何?
研究人员在三个非常不同的 AI 模型(MiniMax、Qwen 和 GLM)上测试了这一方法,使用的是一个名为 Terminal-Bench-2.0 的基准测试,这就像是一个 AI 必须使用电脑终端来解谜的游戏。
- 起点: 他们给了这三个 AI 一个非常基础、极其简陋的规则手册。
- 结果: 在运行了这个自我改进循环后,所有三个 AI 在解决谜题方面的能力都显著提升了。
- 其中一个 AI 从解决约 40% 的任务提升到了 60% 以上。
- 另一个从 23% 提升到了 38%。
- 第三个从 42% 提升到了 57%。
“顿悟时刻”:不同的 AI 需要不同的修复方案
论文发现了一个非常有趣的现象:这种“修复方案”对每个人来说并不一样。因为 AI 的“个性”或思考方式不同,它们需要的规则手册修改也不同。
- MiniMax 擅长探索,但不擅长收尾。修复方案是:制定一条“尽早创建最终文件”以及“如果你请求帮助次数过多,则停止循环”的规则。
- Qwen 擅长开始,但经常不小心删掉自己的工作。修复方案是:制定一条“先检查依赖项”以及“除非确定,否则绝不删除文件”的规则。
- GLM 容易陷入长时间的研究阶段,却从未真正动手构建。修复方案是:制定一条“在一定时间后从探索转向构建”的规则。
核心结论
论文得出结论,我们并不总是需要人类专家或“超智能”AI 来修复这些系统。如果我们给 AI 提供正确的工具,让它能够观察自身的失败,并赋予它只有在证明有效时才接受变更的纪律,它就可以进化出属于自己的操作系统。
这就像是一个电子游戏角色,在死掉几次之后,摸索出了击败关卡的完美策略,然后为下一轮自动更新了自己的“攻略秘籍”,全程无需他人干预。论文表明,即使从一个非常简单的起点开始,这也是可以实现的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。