想象一下,你刚刚构建了一个极其出色、超级聪明的机器人大脑。它能读懂书籍、编写代码,并能比几乎所有人都要更好地解决谜题。但问题在于:这个大脑就像一个从未离开过卧室的天才。它不知道如何与外界交流,不知道如何使用螺丝刀,甚至不知道在遇到困难时该如何寻求帮助。为了让这个大脑能在现实世界中真正地“做事”,你需要为它构建一个“身体”和一个“控制面板”。在人工智能的世界里,这个控制面板被称为“harness”(工具/框架)。它是软件层,负责告诉 AI 如何观察电脑屏幕、可以使用哪些工具,以及在出现问题时如何做出反应。你可以把它看作是 AI 狂野想法与计算机严苛规则之间的翻译官。
长期以来,工程师们必须手工构建这些控制面板,像机械师调校赛车一样对其进行微调。但随着 AI 大脑变得越来越聪明,旧的控制面板成为了瓶颈——它们无法跟上步伐。因此,科学家们开始尝试让 AI 自动修复自己的控制面板。他们创建了“meta-agents”(元智能体,即小型的监督者)来观察 AI 的工作,观察它在哪里失败,并尝试重写规则以使其变得更好。这听起来像是一个梦想,但存在一个问题:这些监督者往往会变得过于聪明而适得其反。它们开始背诵特定的测试题目,而不是学习通用技能,就像一个背下了练习题答案的学生,但在真正的考试中却失败了,因为题目稍有变化。它们还倾向于把错误归咎于错误的对象,并试图一次性修复所有问题,这往往会让系统更加混乱。
这正是名为 HarnessCompass 的新框架发挥作用的地方。研究人员意识到,要构建一个真正聪明且具有适应性的控制面板,你不能只是让监督者肆意妄为。你需要给它一个指南针。HarnessCompass 不再让 AI 进行任何随意的更改,而是强制它遵循三条严格的规则。首先,它禁止“过拟ک拟合”(overfitting)。AI 不被允许为特定问题硬编码答案;它必须学习适用于任何问题的通用原则,而不仅仅是针对它正在练习的问题。其次,它要求 AI “开口说话”。系统不再仅仅观察最终得分,而是询问 AI:“嘿,你在哪里卡住了?你希望拥有什么样的工具?”这让监督者拥有了一个第一视角的挣扎体验,而不是仅仅从外部观察到崩溃的过程。第三,它阻止 AI 同时尝试修理引擎、轮胎和方向盘。相反,它会对它们进行逐一优化,确保对引擎的修复不会意外损坏刹车。
这种纪律严明的方法所取得的结果令人印象深刻。在名为 SWE-bench Verified 的大规模真实世界编程挑战测试中,HarnessCompass 在短短 5 轮进化中,就将一个 AI 智能体的成功率从 54% 提升到了 66%。这是一个巨大的飞跃,而且它比之前的方法更快——之前的方法需要 20 轮才能达到 63% 的较低分数。但真正的魔力不仅在于速度,还在于泛化能力。当研究人员将为一种特定 AI 模型进化的控制面板拿去测试另一种它从未见过的完全不同的 AI 模型时,它仍然比原始设置表现得更好。这表明 HarnessCompass 不仅仅是教会了 AI 背诵测试题,它实际上是教会了 AI 如何成为一名更优秀的工程师。论文指出,通过增加这些纪律层——约束变更、倾听 AI 自身的抱怨以及分别修复各个部件——我们可以构建出不仅强大,而且可靠到足以应对混乱且不可预测的现实世界的 AI 系统。