← 最新论文
🤖 AI

StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling

本文介绍了 StateM,这是一种利用持久状态、检查式转换和版本化运行手册来实现支架扩展的智能体原生运行时,它将 Terminal-Bench 2.1 上的长程智能体准确率显著提升至 95.3%,同时与基准模型相比大幅降低了推理成本。

原作者: Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang, Kai Wang

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang, Kai Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能这一快速发展的领域中,一个持久的谜题出现了:为什么那些能够独立解决复杂步骤的高级计算机程序,在被要求完成一项长期的、多步骤的工作时却往往会失败?想象一位出色的建筑师,他能设计出一个完美的房间,却忘了打地基;或者一位熟练的外科医生,他完成了一次完美的切口,却在手术中途失去了对患者生命体征的追踪。这些被称为“长程智能体”(long-horizon agents)的系统频繁出错,并非因为它们缺乏智能,而是因为它们在过程中迷失了方向。它们可能会忘记自己已经做了什么,跳过必要的检查,或者在最终目标真正达成之前就停止了工作。多年来,标准的解决方案一直是构建更大、更聪明的“大脑”,希望更强大的模型自然就不会犯这些错误。然而,一种新的研究方向表明,问题可能不在于大脑本身,而在于它工作的环境。

研究人员开始提出了一个不同的问题:这种失败在多大程度上实际上是由于那个承载智能体注意力、追踪其进度并强制其完成工作的系统失效所导致的?这种被称为“护栏缩放”(harness scaling)的方法提议,我们可以通过改进围绕现有能力模型的工具和规则,使现有的、有能力的模型变得更加可靠,而不必改变模型本身。与其试图强迫模型依靠自身去记住一切,不如给智能体一个共享的、外部的笔记本,让它和人类监督者都能阅读并更新这个笔记本。这个笔记本充当了一个持久的记录,记录着智能体目前处于何处、下一步承诺要做什么,以及在进入下一阶段前需要提供什么样的证明。通过将执行过程视为一系列具有清晰检查点的不同阶段,该系统确保了智能体不会偏离航线或在任务完成一半时就半途而废。

由秦子恒(Ziheng Qin)及其同事领导的研究团队构建了一个名为 StateM 的轻量级系统来测试这一想法。他们将其设计为能够与标准的计算机智能体协同工作,这些智能体通过命令行进行操作,就像人类在终端输入指令一样。其核心发明是一个简单且易读的文档,称为“运行手册”(runbook)。该文档既是智能体的地图,也是一份契约。它将大型任务分解为特定的阶段或状态,例如规划、构建、检查和交付工作。当智能体进入一个新阶段时,系统会刷新其指令,并明确展示它在离开该阶段前需要完成的任务。至关重要的是,智能体不能仅仅宣布某个阶段已完成;它必须通过验证检查。如果智能体试图跳过步骤或未能通过检查,系统会拦截它,并强制其在继续进行之前修复错误。这创造了一个共享空间,使智能体和人类可以共同检查工作、审计决策并共同更新规则。

为了验证这种方法是否有效,团队在由 89 个复杂计算机任务组成的严苛测试集 Terminal-Bench 上对其进行了测试。他们首先使用了一个强大的模型 GPT-5.5,并应用了他们的新系统。结果令人瞩目。在没有改变模型内部代码或对其进行新数据训练的情况下,该系统将模型的成功率从 83.1% 提升到了 92.1%。这一增幅非常显著,有效地缩小了该旧模型与更新、更先进版本软件之间的差距。随后,研究人员将完全相同的规则(即运行手册)应用于一个更新的模型 GPT-5.6,而没有进行任何调整。该系统表现得甚至更好,在数百次试验中实现了 95.3% 的原始准确率。它成功解决了 89 个任务中的每一个,至少完成了一次,证明了为一种模型开发的规则可以无缝转移到更新的模型上。

研究还探讨了是否可以通过更便宜、不同类型的 AI 模型来实现这些收益。当他们将同样的原则应用于名为 DeepSeek-V4 Flash 的模型时,初步结果并不理想,因为精确的规则并不完全契合。然而,通过花费极少的费用(不到 38 美元)来使特定实践适应这一新模型,他们成功将其性能从 82.7% 提升到了 88.1%。证明这一结果的总成本(包括适配和最终测试)约为 52 美元。相比之下,为了获得类似高水平结果而提交的最昂贵的公开方案花费了近 600 美元。这表明,投资于更好的执行系统,比单纯购买最强大的模型要具有更高的成本效益。

研究人员还在另一组涉及业务工作流(如审批预算或操作机械)的任务上测试了他们的系统。在这里,结果显示,当规则与工作的具体性质相匹配时,效果最好。对于需要严格遵守规则和清晰交接的任务,该系统提供了巨大的改进,有时甚至使成功率翻倍。然而,对于结构非常不同的任务,如果规则过于僵化或应用于错误的环节,系统有时反而会产生负面影响。这让研究人员明白,关键不在于为每种可能的情况准备一份庞大的规则清单,而在于识别错误最容易发生的特定边界,并在那里实施检查。

最终,这项工作表明,人工智能的可靠性既取决于我们如何管理它的工作,也取决于它的模型有多聪明。研究人员确定了能力出众的智能体失败的三个主要原因:它们在决策时刻缺乏正确的知识,它们忘记了从以往尝试中吸取的教训,或者它们未能遵循已经知道的程序。他们的系统通过保持当前阶段新鲜且清晰的记录、将经验教训存储在可重复使用的版本化文档中,以及强制要求智能体在进入下一阶段前证明其已完成当前步骤,从而解决了这些问题。研究结果表明,我们并不一定需要等待下一代超智能模型的出现来解决复杂问题。相反,通过构建更好的系统来引导我们现有的模型,我们可以将那些有能力但不可靠的智能体转变为稳健的、能把事做完的机器。前进的道路不仅是让“大脑”变得更大,更是要为它构建一个更好的“身体”,以支撑它完成工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →