DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
DoVer 是一个面向大语言模型多智能体系统的干预驱动型自动调试框架,它通过通过针对性干预来主动验证假设,并以任务恢复和进展而非归因准确性作为衡量成功的标准,从而克服了仅依赖日志进行故障定位的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一支数字助手(AI 智能体)团队,正齐心协力解决一个复杂的谜题,比如在互联网上寻找某个特定的历史事实,或者解决一道高难度的数学题。有时,这个团队会卡住或给出错误的答案。这被称为“失败”。
长期以来,当这些团队失败时,开发人员试图通过阅读发生的“日记”(日志)来修复它们,并询问一个聪明的 AI:究竟是谁犯了错,以及在何时犯的错。这就像是在观看一场车祸电影,然后试图指出司机转向的确切秒数。
该论文认为,这种“猜谜游戏”存在缺陷,原因有两个:
- 日记很混乱: 通常并不存在单一清晰的错误。团队可能会尝试策略 A,失败,然后尝试策略 B,再次失败。定位一个单一的“罪魁祸首”往往是不可能的,因为整个过程非常混乱。
- 仅仅靠猜是不够的: 即便你猜对了那个人,在实际动手修复之前,你并不知道自己是否真的正确。
解决方案:DoVer (先做后验 - Do-then-Verify)
作者引入了一个名为 DoVer 的新系统。DoVer 不仅仅是猜测谁错了,它说:“让我们试着修复它,看看是否奏效。”
把 DoVer 想象成一个带着时光机的机械师,他不仅是看着那辆坏掉的车,而是真的回到过去,调整了一下引擎,然后再次驾驶它,看看它能否正常运转。
以下是 DoVEr 的工作原理,使用一个简单的类比:
1. 将故事拆分为章节 (尝试分段 - Trial Segmentation)
当 AI 团队失败时,它们通常会经历几个“尝试”或“章节”。在第一章中,它们尝试通过滚动网页来寻找答案。在第二章中,它们意识到那行不通,于是尝试使用日历工具。
- DoVer 的动作: 它将冗长、混乱的故事切割成这些不同的章节(尝试),以便它可以分别分析每一次尝试。
2. 进行有根据的猜测 (假设生成 - Hypothesis Generation)
对于每个章节,DoVer 会询问一个聪明的 AI:“根据这个故事,哪里出了问题?”
- 猜测: “我认为问题在于‘网络浏览器’智能体尝试点击了一个不存在的按钮。”
3. “做”的部分:干预 (The Intervention)
这是神奇的一步。DoVer 不仅仅是写下它的猜测,它实际上改变了故事。它回到“日记”中的那个特定时刻,并修改了指令。
- 编辑: 它告诉网络浏览器智能体:“不要点击那个按钮。相反,请滚动到页面底部。”
- 类比: 想象你正在导演一场戏。演员说错了台词。DoVer 不仅仅是写下一张纸条说“你说错了台词”。DoVer 停止表演,走上舞台,向演员耳语正确的台词,然后说:“现在,说这一句。”
4. “验证”的部分:重新运行这出戏 (Re-Running the Play)
在做出编辑之后,DoVer 让 AI 团队从那个确切的点继续进行。
- 如果团队解决了谜题: 那么猜测是正确的!干预奏效了。
- 如果团队仍然失败: 那么猜测就是错误的。也许问题不在于那个按钮,而是其他完全不同的东西。
他们发现了什么?
研究人员在两种不同的 AI 团队设置和多个困难数据集(如 GAIA 和 AssistantBench,这些类似于 AI 的高难度考试)上测试了 DoVer。
- 化失败为成功: DoVer 成功地将 18% 到 28% 的失败尝试转化为了成功。在某一个特定的数学数据集中,它修复了 49% 的失败案例。
- 即使没有赢得胜利也能取得进展: 即使 DoVer 没有解决整个谜题,它也经常能帮助团队比之前“走得更远”(例如到达下一个里程碑)。
- 测试猜测的准确性: DoVer 证明了大约 30% 到 60% 的关于“谁错了”的初始猜测实际上是正确(或错误)的。这非常重要,因为这意味着我们可以停止依赖不确定的直觉猜测,转而开始使用实际的证据。
为什么这很重要(根据论文观点)
论文声称,干预(实际修复并重新运行)是一种比仅仅进行归因(猜测谁该负责)更好的 AI 团队调试方式。
- 旧方法: “我认为智能体 A 在第 5 步出错了。”(未经证实的猜测)。
- DoVer 方法: “我修改了智能体 A 在第 步的指令。现在团队成功了。因此,智能体 A 就是问题所在。”(经过证实的实事)。
作者总结道,这种“先做后验”的方法让 AI 系统变得更加可靠,因为它关注的是结果(是否奏效?)而不是仅仅关注责备(谁做的?)。它还强调,有时问题不仅仅是一个糟糕的指令,而是智能体所使用的工具缺乏能力(例如一个无法正常滚动的浏览器),而该系统现在可以识别出这一点。
简而言之: DoVer 停止了 AI 调试变成一场“谁是凶手?”的游戏,并将其转变为一场“让我们修复它并看看效果”的游戏。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。