← 最新论文
💻 computer science

MARCA: Multi-Agent Root Cause Analysis with Multi-Modal Data

该论文提出了 MARCA,这是一个多智能体框架,通过使用控制器-执行器-投票者架构来解决分布式系统中的根因分析挑战,从而在降低 Token 使用量并确保数据隐私的同时,实现高准确率和高效率。

原作者: Yidan Wang

发布于 2026-09-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Yidan Wang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代软件系统不再是单一的、单体式的机器;它们是庞大而复杂的数字城市,由被称为微服务的无数微小且独立的程序组成,这些程序之间不断进行着通信。当这座数字城市的某个部分发生踉跄时,整个网络都可能陷入停滞,导致从支付延迟到网站崩溃等各种问题。找出究竟是哪个微小的程序导致了崩溃,这项任务被称为根因分析(Root Cause Analysis)。几十年来,工程师们一直试图将这种搜索过程自动化,但由于数据量(日志、性能指标和错误代码)过于庞大,传统的工具很难跟上节奏。最近,被称为大语言模型的强大计算机程序展现出了潜力,它们能够像人类专家一样阅读并理解这些杂乱的数据流。然而,这些模型也面临着自身的障碍:它们可能会被过量的信息淹没,运行成本高昂,且将敏感的公司数据发送到外部服务器会引发严重的隐私担忧。

卢森堡大学的一位研究人员开发了一种名为 MARCA 的新方法来解决这些问题。MARCA 并非依赖于一个读取所有内容并猜测答案的单一庞大计算机程序,而是将工作分解为一小组专业的数字工作者。想象一下一个侦探团队:一个人负责指导调查,另一个人负责收集特定的线索,而第三个人则负责权衡证据以做出最终判断。这个团队在一个循环中协作,通过提问、收集数据并不断完善他们的理论,直到他们确信已经找到了故障的真正源头。通过分工协作,该系统避免了被海量数据所困,将敏感信息保留在本地服务器以保护隐私,并且比以往的方法使用了更少的计算资源。

研究人员在他们自行构建的一个模拟支付平台上,以及其他科学家使用的公开基准测试集上测试了这个多智能体系统。他们在系统中注入了各种类型的故障,例如使处理器过载、填满内存或切断网络连接,以观察 MARCA 是否能正确识别出罪魁祸首。结果非常明确:新系统正确找到根因的概率约为 77%,这比现有最优秀的方法(其准确率在 62% 左右徘徊)有了显著提升。它在区分不同类型的故障(例如区分网络减速和内存短缺)方面也表现得更为出色,取得了极高的准确度得分,这表明它能够处理现实世界系统中那些杂乱且相互重叠的信号。

这种方法的独特之处在于它如何处理信息的流动。传统方法通常试图将所有可用数据一次性喂给单个模型,这可能会让系统感到困惑,或者迫使它为了容纳所有内容而忽略重要的细节。相比之下,MARCA 更像是一个专注的调查员。它从发现问题的地方开始,然后有系统地检查指向源头的连接。在每一步中,“控制器”智能体会决定下一步该看哪里,“执行器”智能体会使用专门的工具获取相关的日志或性能数据,而“投票者”智能体会结合这些发现来更新嫌疑名单。这个过程不断重复,直到证据强烈指向某一个特定的服务。这种方法使得系统能够忽略无关数据,保持任务的可控性和高效性。

研究还强调,仅仅使用更强大的语言模型并不能解决问题。当研究人员将这种基于团队的方法与尝试独立完成全部工作的单一强大模型进行对比时,发现基于团队的系统表现依然显著更好。这表明,调查的结构——即智能体如何协作、过滤噪声以及权衡不同类型的证据——比单个模型的原始智能水平更为重要。该系统还被设计为具有适应性;它可以从过去的错误中学习,以调整对不同类型数据的信任程度,例如根据以往在不同场景下的表现,决定是更多地依赖错误代码还是性能指标。

虽然研究结果令人鼓舞,但研究人员也谨慎地指出了其工作的局限性。该系统依赖于拥有一张准确的服务连接图谱;如果这张图谱缺失或过时,调查就可能偏离轨道。此外,在多个问题同时发生的情况下,系统有时难以分离重叠的症状。然而,核心结论依然成立:通过将分析组织成一个协作式的迭代过程,可以比以往更准确、更高效地诊断复杂的软件故障。这种方法为保持大规模数字系统的平稳运行提供了一条切实可行的路径,确保在出现问题时,能够快速找到正确答案,而不必牺牲数据安全或耗费过多的计算资源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →