← 最新论文
🤖 AI

StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments

StarHarness 是一个通过在保持模型权重固定的情况下,利用分层搜索来演进特定环境的测试套件(harnesses),从而显著提升智能体在企业级环境中的性能,并在基准测试得分和跨不同模型家族的泛化能力方面取得了实质性的提升。

原作者: Esakkivel Esakkiraja, Denis Akhiyarov, Vikas Yadav, Sai Rajeswar, Patrice Bechard, Sridhar Nemala, Sagar Davasam

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Esakkivel Esakkiraja, Denis Akhiyarov, Vikas Yadav, Sai Rajeswar, Patrice Bechard, Sridhar Nemala, Sagar Davasam

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代计算领域,出现了一类被称为“智能体”(agents)的新型智能程序。它们不仅仅是遵循单一指令的简单工具,而是旨在进行推理、观察信息并采取行动以解决复杂问题的系统,就像人类员工一样。为了发挥功能,这些智能体依赖于两个截然不同的部分:第一部分是“大脑”,即大型语言模型,它提供推理和知识;第二部分是“束缚”(harness),它充当智能体的手、眼和耳。束缚定义了智能体如何观察世界、可以使用哪些工具以及如何检查自己的工作。多年来,科学家们几乎完全专注于让大脑变得更大、更聪明。然而,在充满规则且混乱的商业环境现实中,即使拥有一个天才的大脑,如果它的“手”很笨拙,或者它不理解所工作的办公室的具体规则,仍然会失败。这提出了一个实际的问题:如果我们无法改变大脑,能否通过改进“手”和规则来让智能体表现得更好?

ServiceNow 的研究团队与来自学术机构的合作者共同致力于回答这个问题,他们提出了一个名为 StarHarness 的新框架。他们专注于企业环境中发现的一个特定挑战,即软件必须管理诸如 IT 系统、财务工作流和客户服务记录等事务。在这些环境中,软件必须与具有严格且往往是隐藏规则的数据库和工具进行交互。研究人员希望看看他们是否可以在不触动底层大脑的情况下,自动改进智能体的束缚。他们将束缚视为一段可以被演化或改进的代码,通过试错法来进行优化。其目标是找到一种更好的方式,让智能体能够构建任务框架、使用工具并验证结果,同时保持模型的内部权重完全冻结。

为了测试他们的想法,研究人员创建了一个能够以受控方式搜索改进方案的系统。他们首先在大量任务上运行智能体,以观察其典型失败之处。然后,他们将这些任务分为三组:一组用于提出修改建议,一组保持隐藏以测试修改是否奏效,第三组则留作最终的无偏检查。该系统会针对束缚提出微小的改动建议,例如修复工具调用的方式,或添加一条规则以防止常见的错误。随后,它会在隐藏组上测试这一改动。如果改动使智能体表现得更好,系统就会保留它;否则,则将其丢弃。这一过程不断重复,使得束缚得以缓慢演化成一个功能更强大的版本。研究人员在三种不同类型的业务挑战中使用了这种方法:分析计算机网络故障、管理 IT 服务请求以及处理财务工作流。

结果令人瞩目。在系统仅接受了极少数次改动(通常在每个环境中为 4 到 12 次调整)后,智能体的性能便大幅跃升。在基准测试中,全量基准性能较默认束缚提升了 20–35 个百分点。具体而言,在网络分析任务中,成功率提高了 35 个百分点;在 IT 服务管理测试中上升了 20 个百分点;在财务工作流中则攀升了 26 个百分点。至关重要的是,这些改进并非仅仅源于对训练期间所见问题的记忆。当研究人员在新的、未见过的任务上测试演化后的束缚时,智能体的表现依然比之前好得多。更令人惊讶的是,这些改进可以迁移到不同类型的 AI 模型上。使用某一特定模型族演化出的束缚,在交给完全不同的模型族时,无需任何进一步的训练或调整,同样能表现出色。

研究人员分析了这些变化,以了解系统究竟学到了什么。他们发现,改进可以归纳为三个清晰的类别。首先,系统修复了智能体与其工具之间的接口,解决了导致智能体调用工具错误的问题。其次,它学习了环境中的隐藏惯例,例如某些步骤必须遵循的特定顺序,或者如何正确处理日期和优先级。第三,它通过增加操作性知识压缩了搜索过程,使智能体能够跳过不必要的步骤,专注于问题的最可能原因。例如,在财务任务中,演化后的束缚学会了在做出任何更改之前先检查安全违规情况,这极大地减少了错误数量。在网络分析任务中,智能体学会了在找到疑似原因后立即停止搜索,而不是浪费时间寻找并不需要的更多证据。

这些发现表明,对于许多现实世界的商业应用而言,最大的障碍并非模型的智能程度,而是引导它的系统设计。通过演化束缚,研究人员能够减少误诊次数、缩短完成任务的时间,并降低运行智能体的成本。这项研究证明,当周围的工具和规则被精心调整以适应特定环境时,一个固定且不变的大脑可以变得异常高效。这为那些需要可靠 AI 智能体且不愿等待下一代更大规模模型开发的组织,提供了一条切实可行的路径。这项工作表明,有时,最强大的升级不是一个新的头脑,而是一种更好的工作方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →