← 最新论文
💻 computer science

From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws

本文介绍了 HarnessFix,这是一个通过分析执行轨迹和测试桩代码来诊断智能体故障,并生成针对性且经过验证的补丁的轨迹引导型框架,该框架显著提升了大型语言模型智能体在多个基准测试中的可靠性。

原作者: Mengzhuo Chen, Junjie Wang, Zhe Liu, Yawen Wang, Qing Wang

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Mengzhuo Chen, Junjie Wang, Zhe Liu, Yawen Wang, Qing Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个才华横溢但有时会感到困惑的助手(LLM Agent/大语言模型智能体),正试图解决复杂的谜题,比如修复一个损坏的计算机程序或规划一次旅行。这个助手并不是独自工作的;它在一个由工程师构建的“控制室”内工作。这个控制室被称为Harness(控制架/环境框架)

Harness 是指一套规则、工具和安全检查机制,它告诉助手:

  • 它可以使用哪些工具(比如螺丝刀或搜索引擎)。
  • 它能看到哪些信息(比如地图或手册)。
  • 如何汇报进度。
  • 何时停止并说:“我完成了。”

问题:“黑盒”式失败

有时,助手会失败。在过去,当事情出错时,工程师们尝试通过以下方式进行修复:

  1. 微调助手的指令: “嘿,试着更细心一点!”(这就像是在不修理坏掉的刹车的情况下,告诉司机“开好车”)。
  2. 靠猜: 观察最终结果,并寄希望于随机的改动能有所帮助。

问题在于,这些方法往往无法抓到真正的症结所在。失败可能并不是助手的错;可能是 Harness 给助手提供了错误的工具、隐藏了关键的错误信息,或者让助手在任务完成前就退出了。由于助手的行为发生在一连串漫长且混乱的事件链中,很难精准定位到底是控制室的哪个环节出了问题。

解决方案:HARNESSFIX(侦探)

论文作者创建了一个名为 HARNESSFIX 的新系统。你可以把它想象成控制室的法医侦探。它不是靠猜测,而是通过对“犯罪现场”(失败的尝试过程)进行逐步调查,来找到 Harness 中确切损坏的部分。

以下是 HARNESSFIX 的工作原理,使用了一个简单的类比:

1. “翻译官”(HTIR)

首先,侦探将混乱、令人困惑的运行日志(“trace/追踪记录”)和控制室的代码,翻译成一张清晰、有序的地图,称为 HTIR

  • 类比: 想象一个混乱的犯罪现场,到处是散落的线索。侦探将它们整理成一条清晰的时间线:“10:00,智能体请求了一个工具。10:01,工具返回了一个错误。10:02,智能体忽略了这个错误。”这张地图将智能体的行为直接与管理它们的规则联系起来。

2. “诊断”(寻找罪魁祸首)

接下来,侦探通过查看地图来寻找链路断裂的确切位置。

  • 类比: 侦探会问:“智能体失败是因为不知道密码?还是因为门被安全系统(Harness)锁住了?”
  • HARNESSFIX 会识别问题是出在 工具接口(指令错误)、生命周期(让智能体过早退出)还是 可观测性(隐藏了错误信息)。它会针对重复出现的问题生成一份特定的“缺陷报告”。

3. “修理厂”(局部修复)

一旦确定了缺陷,HARNESSFIX 不会让任何人随意重写整个控制室。那样做很危险,可能会破坏其他功能。相反,它使用了一套 修复算子(Repair Operators)

  • 类比: 把这些算子想象成机械师工具箱里的特定工具。如果问题是螺栓松了,机械师就用扳手;如果问题是轮胎没气了,他们就用千斤顶。HARNESSFIX 只使用针对该特定缺陷所需的特定“扳手”。它编写一段小巧、精确的补丁来修复那个特定的损坏部分,确保不会意外损坏引擎。

4. “安全检查员”(验证)

在安装新的补丁之前,一名安全检查员会对它进行检查。

  • 类比: 检查员会问两个问题:
    1. “这个修复解决了我们发现的具体问题吗?”
    2. “这个修复是否意外破坏了原本正常工作的其他部分?”
  • 如果第二个问题的答案是“是”,那么补丁将被拒绝。这防止了系统在试图变好时反而变得更糟。

他们发现了什么?

研究人员在四种不同类型的困难任务(修复软件、使用命令行、进行研究以及自动化应用)上测试了这个侦探系统。

  • 结果: 与原始设置相比,HARNESSFIX 将智能体的成功率提高了 15% 到 50%
  • 对比: 它的表现优于:
    • 手动设计控制室的 人类专家
    • 试图通过仅仅改变指令或靠猜来进行自我修复的 其他 AI 系统
  • 发现: 他们发现许多失败并不是因为 AI “笨”,而是因为“控制室”存在隐藏的缺陷,例如隐藏了错误信息或让 AI 过早退出。HARNESSFIX 找到了这些隐藏的缺陷并修复了它们。

总结

HARNESSFIX 是一个将失败的 AI 尝试视为“犯罪现场”进行处理的系统。它不仅仅是责备 AI;它会调查 AI 工作的环境,找到具体的损坏规则或工具,并应用精确且安全的修复。这使得 AI 更加可靠,而无需重新训练 AI 的“大脑”或去猜测到底哪里出了错。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →