← 最新论文
🤖 AI

Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents

Evo-Harness 引入了一种自我演进的智能体框架,该框架通过采用从上下文到挂件(context-to-harness)的技能编译技术,将经验提炼为可重用的、结构化的技能挂件,从而解决在处理现实世界新颖任务时,从噪声多且单次交互中学习的挑战,以实现持续的跨领域提升。

原作者: Tianxin Wei, Zhan Shi, Minhua Lin, Bing He, Zewen Liu, Yisi Sang, Yuanchen Bei, Xuying Ning, Jiaru Zou, Ting-Wei Li, Xiao Lin, Yanjun Zhao, Chi Wang, Benoit Dumoulin, Dakuo Wang, Jingrui He, Hanqing L
发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianxin Wei, Zhan Shi, Minhua Lin, Bing He, Zewen Liu, Yisi Sang, Yuanchen Bei, Xuying Ning, Jiaru Zou, Ting-Wei Li, Xiao Lin, Yanjun Zhao, Chi Wang, Benoit Dumoulin, Dakuo Wang, Jingrui He, Hanqing Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,一种被称为“大语言模型智能体”(large language model agent)的特定软件已成为解决复杂问题的强大工具。这些智能体能够像人类一样阅读指令、规划步骤、使用数字工具,并与网站或计算机系统进行交互。然而,一个持久的挑战限制了它们的潜力:当这些智能体在任务中失败时,它们往往将该失败视为死胡同。它们不会自然地从错误中学习,以避免日后重蹈覆辙。传统的教学方法通常涉及收集数千次过去的尝试,并进行离线分析以寻找模式,这个过程缓慢且往往与实际工作的实时流程脱节。在许多实际场景中,智能体仅有一次机会遇到一个新的、困难的任务,只有一次成功或失败的机会,这使得传统的、需要缓慢积累数据的学习方式几乎没有发挥空间。

研究人员现在提出了一种让这些数字工作者能够即时提升自身能力的新方法,他们称之为“在线束缚学习”(online harness learning)。这种方法并非试图重新训练智能体那通常固定且不可更改的核心大脑,而是为其附加了一个随每一次新经验而进化的外部“指南手册”。这个指南手册(或称“束缚”,harness)充当了一个从过往尝试中总结出的结构化经验集合。当智能体失败时,系统不仅仅是存储错误,而是积极地将失败的混乱细节编译成一条清晰、可重用的规则。这条规则随后会被添加到指南手册中,准备在未来帮助智能体应对类似的挑战。其目标是将嘈杂的一次性错误转化为一条干净、可操作的智慧,并使其能够应用于不同类型的任务。

为了测试这一构想,研究人员构建了一个名为 Evo-Harness 的系统,并让它在五个不同且具有挑战性的基准测试中接受考验。这些测试范围涵盖了从导航复杂的网站到管理软件代码库,再到执行精确的命令行指令以及使用各种数字工具。在每种场景下,智能体都会接收到一系列连续的任务,且没有机会暂停并重新训练其底层模型。该系统的设计旨在提取每次尝试的原始上下文——包括给出的指令、采取的行动、结果以及收到的反馈——并将其提炼为结构化的教训。如果智能体失败了,一个专门的过程会对出错之处进行反思,提出一条新规则或对现有规则进行修改。随后,另一个过程会决定是将这条新规则添加进去、将其与现有知识合并,还是如果该规则过于针对单次失败尝试则将其丢弃。

实验结果令人瞩目。使用该进化指南手册的智能体表现始终优于未使用指南的智能体,也击败了其他依赖于简单检索过去案例或存储非结构化记忆的方法。在一个专注于命令行任务的基准测试中,提升尤为显著,成功率从大约 63% 跳升至 73% 以上。这表明,将嘈杂的一次性经验编译成结构化引导的能力,在需要精确操作序列的任务(如检查文件或从错误中恢复)中特别有价值。研究还发现,系统生成的引导类型会根据任务的不同而变化:对于网页导航,指南手册充满了工作流程序;对于软件工程,它侧重于验证和恢复步骤;而对于推理任务,它则捕捉领域特定的逻辑。这种适应性表明,该系统不仅是在记忆答案,而且是在学习解决问题的底层结构。

这项研究的一个关键洞型在于,并非所有的反馈都是同等重要的。当系统接收来自环境的清晰、具象的反馈(例如特定的错误消息或测试结果)时,表现最为出色;而当它被要求自行判断成功与否时,表现则不如前者。当智能体试图在缺乏外部证据的情况下生成自己的反馈时,其性能实际上跌破了基准线,这表明自我判断可能会引入混乱。此外,研究显示,智能体“大脑”的大小和能力至关重要。更强大的模型能更好地理解并遵循进化的引导,从而从系统中获得显著更多的收益,而较弱的模型则不然。有趣的是,较小的模型有时可以编写出一份帮助更强大模型的指南手册,但反之则不一定成立。如果执行任务的智能体本身不够先进,无法理解这些引导,那么额外的信息不仅没有帮助,甚至可能阻碍性能。

研究人员还探索了这些习得技能的可迁移性。他们发现,由一个模型创建的指南手册对另一个模型也是有用的,并且在训练任务上学到的技能可以提高在未见过的测试任务上的表现。然而,最有效的方法是随着智能体处理任务流的过程持续更新指南手册。这种实时适应能力使系统能够根据当前环境的具体特性和失效模式进行调整,其表现甚至超过了那些经过精心预训练的指南手册。研究结论指出,智能体实现自我提升的关键不在于不断重新训练其核心模型,而在于构建一个稳健的外部系统,能够将现实世界的混乱失败转化为一套清晰、有组织的指令。通过将指南手册视为一份随着每一次交互而生长和完善的“活文档”,这些数字智能体便能学会应对复杂且多变的现实工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →