Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents
本文介绍了洞察生成器(IG),这是一个多智能体系统,它通过系统性地分析大规模执行轨迹语料库,自动化诊断大语言模型智能体的故障,生成有证据支持的自然语言洞察,这些洞察已被证明能显著提升智能体性能,并在深度和覆盖面上超越人工诊断方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一支由非常聪明但偶尔会困惑的机器人助手组成的团队的管理者。这些机器人正试图解决复杂的谜题,比如整理电子表格或回答高难度的科学问题。有时,它们能给出正确答案;而有时,它们则会失败。
问题:“大海捞针”式的调试
目前,当机器人失败时,人类管理者会尝试通过查看机器人工作的少数几个具体示例来找出原因。这就像试图通过只听一辆汽车驶过的声音,来理解为什么汽车引擎会发出怪声。你可能会听到一阵杂音,但却错过了这样一个模式:所有汽车在下雨天左转时都会发出杂音。
由于机器人会为每一项任务产生海量数据(数千页的“思考”和行动记录),人类无法阅读全部内容。他们最终只能基于极小的样本进行猜测。这意味着他们会错过“静默失败”——即机器人完成了任务且未崩溃,但却以错误的方式执行的失误。
解决方案:“洞察生成器”(IG)
作者构建了一个名为洞察生成器(Insights Generator, IG)的新系统。请将 IG 想象成不是一个单一的侦探,而是一个拥有特定工作流程的专业侦探机构,专门用于解决“大海捞针”的问题。
以下是该机构如何运作,使用一个简单的类比:
- 协调者(机构经理): 这是老板。它自己并不进行挖掘。相反,它审视全局,决定需要何种类型的调查。
- 侦察兵(探索者): 这些特工被派去查看机器人工作的一小部分随机样本。他们的任务是保持广泛和好奇。他们寻找奇怪的图案并提出理论。
- 示例理论: “嘿,我注意到机器人有 80% 的数学失败情况是公式写错了,但并未崩溃。这是一种‘静默失败’。”
- 调查员(法医审计师): 一旦侦察兵提出理论,调查员就会接手。他们不只是查看几个示例;他们会遍历整个庞大的机器人工作数据库(即“语料库”)。他们利用强大的工具进行计数、比较,并证明该理论是否适用于整个群体,而不仅仅是他们看到的那几个样本。
- 结果: 他们不再提供猜测,而是生成一份报告,说明:“我们检查了 1,000 次失败尝试。其中 84% 存在这种特定的静默数学错误。以下是发生该问题的确切页面。”
这有何不同?
大多数其他系统试图一次修复一个机器人,或将错误归类到预设的列表中(如“工具错误”或“逻辑错误”)。IG 的不同之处在于,它能够发现以前无人知晓的新模式。它将“猜测”(侦察兵)与“证明”(调查员)分离开来,从而避免被海量数据压垮。
测试时的结果如何?
研究人员通过两种方式测试了该系统:
- “法官”测试: 他们让一个超级智能的 AI 法官比较 IG 生成的报告与其他系统生成的报告。IG 的报告评分更高,因为它们拥有更好的证据和更深入的解释。这就像比较一份说“汽车坏了”的报告(其他系统)与一份说“汽车在下雨天左转时因电线松动而故障,且此处有视频证据”的报告(IG)。
- “人类修复者”测试: 这是最重要的一部分。他们将 IG 和其他系统生成的报告提供给真实的人类工程师(即制造这些机器人的专家)。随后,这些工程师尝试修复机器人。
- 结果: 使用 IG 报告的工程师,其修复机器人的效果比使用次优系统的工程师高出 30%。IG 报告为他们提供了做出正确更改所需的精确“位置”和“原因”,而不仅仅是一个模糊的提示。
核心结论
该论文声称,通过采用这种“侦察兵与调查员”的团队方法,我们终于能够看清 AI 智能体失败时的隐藏模式。这使得人类专家能够更有效地修复根本问题,将混乱的错误日志堆转化为清晰、有证据支持的改进路线图。
该论文未声称的内容:
- 它并未声称该系统能在无人协助的情况下自动修复机器人(尽管他们测试了一个自动“修补”循环,但主要成功在于人类专家)。
- 它并未声称这适用于世界上每一种类型的 AI 问题,仅适用于分析 AI 智能体的“痕迹”(日志)。
- 它并未承诺消除所有错误,而是旨在使发现和修复这些错误的过程变得更加高效和准确。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。