FALAT: Tracing Failures in LLM Agent Trajectories via Dependency-Guided Search
该论文提出了 FALAT,这是一个通过将问题建模为依赖引导的搜索来改进 LLM 智能体轨迹中故障归因的诊断框架,旨在区分引入错误的步骤与仅传播先前错误的步骤,从而在识别负责的智能体和决定性失败步骤方面优于现有基准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一支由高度智能的机器人组成的团队,它们正在协作解决一个复杂的谜题,比如编写一段软件或规划一次旅行。它们彼此交谈、使用工具并做出决策,形成了一个漫长的事件链。我们称这个链条为“轨迹”(Trajectory)。
有时,团队会失败,最终结果是错误的。但由于这个链条非常长,且机器人之间的对话非常频繁,想要弄清楚谁犯了错以及何时发生的错误,简直难如登天。
这里有一个问题:如果机器人 A 在早期犯了一个微小的错误,机器人 B 可能会做出一个基于该错误看似完全合理的行为。接着机器人 C 也会做一些其他事情,这些事看起来也符合逻辑,但实际上因为建立在机器人 B 的错误之上而变得错误。到最后,整个过程都崩溃了,但每一个步骤在当时看来似乎都是合理的。这就像一场“传声筒”游戏,信息被搞乱了,但每个人都深信自己听得没错。
解决方案:FALAT(侦探框架)
作者创建了一个名为 FALAT 的工具,作为这些机器人团队的侦探。FALAT 不仅仅是观察最终的混乱局面并进行猜测,它使用了一个巧妙的四步流程来寻找根本原因。
以下是 FALAT 如何运作,我们使用简单的类比来解释:
1. “理想剧本”(构建搜索空间)
在观察混乱的现实之前,FALAT 会先写下一个任务应该如何进行的**“理想剧本”**。它了解目标、规则以及一个优秀的机器人应该如何表现。
- 类比: 想象一位导演,他确切知道电影场景应该如何展开。当演员出错时,导演不仅仅是在观看混乱,他们会将实际拍摄的内容与剧本进行对比,以发现演员在哪里偏离了轨道。
- 为什么重要: 如果你只看机器人自身的推理,你可能会被误导,因为它们都在为同一个错误进行合理化辩解。FALFA 使用外部视角(剧本)来保持客观。
2. “变焦镜头”(层级化表示)
机器人的历史记录可能有数百步之长。阅读每一个字既慢又令人困惑。FALAT 会先放大缩小,再逐步深入。
- 类比: 想象观察一片森林。首先,你从直升机上俯瞰整片森林,看看哪个区域看起来病态(高层级)。然后,你放大观察,看看受影响的是哪一组树木(中层级)。最后,你走近地面,检查具体的叶子(底层级)。
- 为什么重要: 这能防止 FALAT 迷失在细节中。它通过先锁定可疑的“邻里区域”来缩小搜索范围。
3. “监管链”(类型化依赖关系)
这是最重要的部分。FALAT 不仅仅指责最后说话的那个人。它会追踪依赖关系(谁依赖于谁)。
- 类比: 想象一场接力赛,有人掉落了接力棒。
- 源头(The Source): 掉落接力棒的那位跑者。
- 传播者(The Propagator): 下一位捡起接力棒并继续奔跑的人,即便接力棒已经坏了。
- 症状(The Symptom): 在终点线处因延迟到达而产生后果的跑者。
FALAT 使用特殊的标签(如“后续行动”、“修正”或“死胡同”)来区分谁是掉落接力棒的人,以及谁只是在携带那个坏掉的接力棒。它会忽略那些仅仅是在重复已有的说法,或者实际上并未对最终结果产生影响的人。
4. “假设测试”(验证)
一旦找到了嫌疑对象,FALAT 不会直接将其逮捕。它会运行一次模拟。
- 类比: 侦探会问:“如果我们回到过去,并且仅修复这一个步骤,整个电影的结果会变正确吗?”
- 如果修复步骤 3 能让最终结果变得完美,那么步骤 3 就是决定性步骤。
- 如果修复步骤 3 后电影依然是破碎的,那么步骤 3 并不是真正的罪魁祸首;错误发生在更早的时候。
它有效吗?
作者在名为“Who & When”的基准测试上测试了 FALAT,该测试包含许多机器人团队失败的案例。
- 结果: 与其他方法相比,FALAT 在找到错误起始的确切步骤方面表现得更好。
- 数据: 在棘手的、人工设计的失败故事中,FALAT 在约 29% 的情况下找到了正确的步骤,而次优的方法仅为 17%。在较简单的、计算机生成的案例中,它的正确率达到了 46%。
- 启示: 尽管 29% 听起来并不高,但在这种“大海捞针”的领域中,这是一个巨大的进步。它证明了你不能仅仅要求一个聪明的 AI 去“猜”谁搞砸了;你需要一种结构化的方式来追踪依赖关系并进行“假设”测试。
总结
FALAT 是一个诊断工具,它不再仅仅指责链条中的最后一人。相反,它:
- 了解事物应该如何运作。
- 缩放并聚焦于可疑区域。
- 追踪信息流,以区分原始错误与产生的后果。
- 测试修复那一个步骤是否能挽救全局。
它将混乱、困惑的失败变成了一场逻辑严密的调查。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。