← 最新论文
🤖 AI

HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry

HarnessX 引入了一个可组合且具有自适应能力的铸造厂,通过替换代数和追踪驱动的多智能体演进,系统性地演进 AI 智能体运行时接口,在不单纯依赖模型规模扩大的情况下,在多种基准测试中实现了显著的性能提升。

原作者: Tingyang Chen, Shuo Lu, Kang Zhao, Weicheng Meng, Hanlin Teng, Tianhao Li, Chao Li, Xule Liu, Jian Liang, Zhizhong Zhang, Yuan Xie, Heng Qu, Kun Shao, Jian Luan

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Tingyang Chen, Shuo Lu, Kang Zhao, Weicheng Meng, Hanlin Teng, Tianhao Li, Chao Li, Xule Liu, Jian Liang, Zhizhong Zhang, Yuan Xie, Heng Qu, Kun Shao, Jian Luan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个才华横溢但缺乏经验的实习生(AI 模型)。你想让他解决一个复杂的问题,比如规划一次旅行、修复一个损坏的网站或是在电子游戏中闯关。

目前,大多数人试图通过雇佣一名“超级实习生”(更大、更昂贵的 AI 模型)来让实习生变得更聪明。但这篇文章——HarnessX——认为,真正的秘诀不仅仅是雇佣一个更好的实习生,而是为他们构建一个更好的办公室、工具箱和规则手册

作者将这种“办公室设置”称为**“护栏”(Harness)**。

问题所在:“手工打造”的办公室

目前,如果你想让 AI 执行一项新工作,人类工程师必须手动为它构建一个定制化的办公室。他们编写特定的指令(提示词)、连接特定的工具并设置记忆系统。

  • 问题: 这些办公室是静态的。如果实习生变了或者工作内容变了,整个办公室都必须从头开始重建。
  • 浪费: 当实习生失败时,我们会观察错误,手动修复办公室,然后重试。我们很少利用这些错误来自动改进办公室,甚至很少利用它们来训练实习生在下次尝试中表现得更好。

解决方案:“护栏铸造厂”(The Harness Foundry)

HarnessX 是一个能够自动构建这些办公室的工厂(“铸造厂”)。它将办公室设置视为一个可以被组装、适配和进化的生命体。

以下是它的工作原理,分为三个简单的部分:

1. 组合(Composition):乐高式办公室

HarnessX 不会构建一个混乱、纠缠不清的办公室,而是由类型化、可互换的乐高积木——称为“处理器”(Processors)——来构建。

  • 类比: 想象办公室有特定的插槽:一个用于“工具”,一个用于“记忆”,一个用于“规则”,还有一个用于“上下文”。
  • 工作原理: 你可以将一个“网页搜索”模块插入“工具”插槽,或者将一个“长期记忆”模块插入“记忆”插槽。因为它们是标准化的模块,所以你可以进行更换而不会破坏整个建筑。这使得办公室具有模块化特征,且更改过程是安全的。

2. 适配(Adaptation):自我进化的管理者(AEGIS)

这是系统的核心大脑。HarnessX 使用一个名为 AEGIS 的特殊管理者来观察实习生的工作,并自动修复办公室。

  • 镜像: AEGIS 将办公室视为一个电子游戏角色。它观察“追踪记录”(即实习生操作的逐步日志),并追问:“他们为什么失败了?是因为工具?规则?还是提示词?”
  • 四步循环:
    1. 消化(Digest): 它读取混乱的日志并总结失败原因。
    2. 规划(Plan): 它决定需要哪种类型的改变(例如,“我们需要一个新工具”对比“我们需要重写指令”)。
    3. 进化(Evolve): 它实际构建出新的办公室配置。
    4. 评判(Critic): 它扮演严格的安全检查员的角色。它测试新的办公室,以确保不会破坏之前运行良好的部分。
  • 结果: 办公室会不断自我完善,无需人类每次都去重写代码。

3. 协同进化(Co-Evolution):双向奔赴

通常情况下,我们要么修复办公室,要么训练实习生。HarnessX 则两者兼顾。

  • 类比: 想象办公室变得更好了,这有助于实习生学习新技巧;随后,实习生变得更聪明了,这使得办公室能够尝试更复杂的任务。
  • 循环: 系统利用实习生的失败来升级办公室,同时利用新的办公室生成更好的训练数据来升级实习生的“大脑”。它们相互成就,共同提升。

实验结果如何?

团队在五个不同的“游戏”(基准测试)上进行了测试,涵盖了从网络购物到软件工程的不同领域。他们使用了三种不同类型的 AI 模型(从小型到大型)。

  • 巨大的胜利: 平均而言,系统将性能提升了 14.5%
  • 超级胜利: 对于较弱的 AI 模型,提升幅度非常惊人——高达 44%
    • 为什么? 论文指出,较弱的模型存在更多的“行为差距”(它们不知道如何处理某些事情)。一个更好的办公室(护栏)可以立即填补这些差距。而强大的模型本身已经很优秀了,所以办公室对它们的帮助相对较小。
  • “卡壳”问题: 在一个非常复杂的测试(GAIA)中,单一的办公室无法解决所有问题,因为某些任务需要的规则是截然相反的。系统通过创建多个版本的办公室(变体)并根据任务类型将其路由到最合适的版本来解决这个问题。这防止了系统在处理新任务时“忘记”如何执行之前的任务。

核心启示

论文得出结论:我们不需要等待 AI 模型变得无限聪明才能获得更好的结果。通过构建一个可组合、可自我进化的运行时环境(护栏),我们可以榨取巨大的性能增益,尤其是在使用较小或能力较弱的模型时。

简而言之: 不要仅仅购买一个更聪明的实习生;要为他们建立一个更智能、具备自我修复能力的办公室,并让他们从自己的错误中学习,从而让这个办公室变得更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →