← 最新论文
🤖 AI

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces

AutoSaddler 是一个自动框架,它通过迭代地诊断来自执行日志的失败追踪并生成结构化代码补丁来优化 LLM 智能体控制台(agent harnesses),从而显著提高智能体在多个基准测试中处理长程任务的鲁棒性和性能。

原作者: Sungho Park, Wonjoong Kim, Rongyuan Tan, Jue Zhang, Wook-Shin Han, Pengfei Gao, Chanyoung Park, Yongqiang Yao, Rao Fu, Elsie Nallipogu, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Sungho Park, Wonjoong Kim, Rongyuan Tan, Jue Zhang, Wook-Shin Han, Pengfei Gao, Chanyoung Park, Yongqiang Yao, Rao Fu, Elsie Nallipogu, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界里,研究人员正越来越多地构建不仅能回答问题,而且能采取行动的系统。这些“智能体”(agents)是受大语言模型驱动的软件程序,它们可以规划一系列步骤、使用数字工具并与计算机环境交互,以解决复杂问题。想象一下,要求一台电脑组织一周的旅行,预订机票并预留酒店。智能体不仅仅是给你一个清单;它会登录、搜索、比较价格并完成预订。然而,当任务变得漫长或复杂时,这些系统往往会遇到困难。过程中的一个小错误,比如误解了一条指令,可能会在数小时后引发连锁反应,导致彻底失败。为了防止这种情况,工程师们在智能体周围构建了一层被称为“护栏”(harness)的保护性代码。这个护栏充当监督者的角色,检查智能体的工作,管理其工具,并确保其不偏离轨道。多年来,设计这种护栏一直是一项缓慢的手动工作,需要人类专家通过手动调整指令和设置,这一过程难以规模化,且常使系统显得脆弱。

一组研究人员引入了一种名为 AutoSaddler 的新方法,该方法实现了整个设计过程的自动化。AutoSaddler 不再依赖人类直觉来修复监督代码,而是将护栏本身视为可以通过严格的测试和学习进行改进的软件。研究人员将该问题表述为一个离线学习任务,这意味着系统是从过去的失败集合中学习,而不是尝试在实时过程中摸索。他们向系统输入了智能体此前未能完成的任务批次。随后,系统分析了这些失败的详细记录(即执行轨迹),以准确理解智能体在哪里以及为什么出错。它不仅仅是在猜测;它深入挖掘代码和日志以寻找根本原因,就像机械师通过听声音和检查零件来诊断汽车引擎,而不是仅仅猜测该拧紧哪颗螺栓。

一旦系统识别出问题,它就会生成一个针对护栏代码的特定、结构化的修复方案,即“补丁”。这些补丁并非随机编辑,而是被细分为三类:对智能体指令的修改、对可用工具的修改,以及对控制其行为逻辑的修改。随后,系统会立即在相同的任务批次上测试这些补丁,以观察其是否奏效。如果一个补丁在解决了眼前问题的同时没有破坏其他功能,系统就会进入第二个关键步骤:检查该修复方案是否能在新的、未见过的任务上奏效。这一步至关重要,旨在确保系统不仅仅是在死记硬背特定问题的答案,而是在以一种更通用的方式变得更加聪明。研究人员构建了一个记忆系统——一个追踪每一次变更、每一次成功和每一次失败历史的有向图,使系统能够从其整个历史中学习,而非仅仅从最近的一次尝试中学习。

这一方法取得的结果非常显著。在涉及复杂任务的三个不同基准测试中,该系统始终优于最初的人工设计护栏。在一组通用助手任务中,自动化系统的成功率提升了 9 个百分点。在软件工程任务基准测试中,它提升了近 10 个百分点,在基于终端的问题解决测试中也获得了 10 个百分点的提升。这些增益足以超越原始的人工设计,也超过了其他试图优化系统的自动化方法。研究人员发现,成功的关键不在于尝试许多随机的变化,而在于专注于深度诊断、进行有针对性的结构化改变,并严格筛选那些被证明具有广泛用途的变更。

该研究明确排除了几种看似直观但被证明无效的常见方法。研究人员表明,仅仅是对失败进行反思而不对代码和日志进行深度调查,会导致修复过于浅显且无法持久。他们还证明,允许系统进行不受约束的随机代码编辑会导致混乱的搜索,这种搜索很少能找到正确的解决方案,往往会纠结于微小的文本微调,而忽略了重大的结构性改进。此外,他们发现,仅针对训练期间看到的特定任务进行优化会导致系统过拟合,这意味着系统虽然在处理这些特定任务时表现出色,但在面对新的变体时却会失败。只有当系统被迫针对一组独立的、未见过的任务进行验证时,其改进才是持久且通用的。

通过广泛的测试,研究人员确认了他们的方法既稳健又高效。该系统达到高水平性能时使用的计算资源远少于竞争方法,实现同样的学习效果所需的尝试次数大约减少了十倍。这种效率源于系统能够从每一次失败中进行深度学习,而不是通过数百万次的随机猜测来尝试暴力破解解决方案。这项研究表明,可靠 AI 智能体的未来在于这些能够系统地调试并完善自身操作指令的自动化、自我改进框架。通过将护栏视为可以通过基于证据的诊断和结构化修复来进行演进的代码,研究人员为开发出更强大、更可靠、且无需人类持续干预即可处理现实世界中长期复杂任务的人工智能系统开辟了一条路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →