← 最新论文
🤖 machine learning

EvoCause: LLM-Guided Evolution of Causal Graphs for Root Cause Analysis

EvoCause 是一个利用大语言模型通过专家诊断标签迭代优化因果图,以提升复杂系统中根因分析性能的新型框架,该框架通过一个新的专家标注基准测试(TeleRCA)进行了验证,并展示了相较于传统因果发现方法显著的性能提升。

原作者: Lei Zan, Keli Zhang, Shifeng Xie, Jiale Zheng, Zehao Xiao, Zhiwei Dong, Ke Zhang, Ruichu Cai, Malik Tiomoko, Lujia Pan

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Lei Zan, Keli Zhang, Shifeng Xie, Jiale Zheng, Zehao Xiao, Zhiwei Dong, Ke Zhang, Ruichu Cai, Malik Tiomoko, Lujia Pan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位巨型高科技飞船的船长。突然间,飞船计算机开始发出成千上万次的警报尖叫:“引擎过热!”、“船体压力下降!”、“导航故障!”这是一场混乱的噪音风暴。你的任务,即根因分析(Root Cause Analysis, RCA),是找出究竟是哪一个微小且具体的警报引发了这一切,以便你在飞船坠毁前将其修复。在现实世界中,这每天都在电信网络和云系统中发生。当其中一个部分损坏时,它会触发连锁反应式的错误。

为了解决这个问题,科学家们经常尝试绘制一张关于警报如何相互触发的“地图”,就像错误引发的家谱一样。他们利用数学方法从历史数据中学习这张地图。但问题在于,数学并不完美。有时地图会有错误的线条或缺失的连接。通常情况下,如果地图错了,计算机就会迷失方向。但是,如果你可以询问人类专家:“嘿,上次你说是这个原因导致的,但你的地图显示它并不是,”然后利用一个超级聪明的 AI 来根据这种反馈来修正地图呢?这正是这篇论文所探讨的问题:如何利用人类的智慧和一个强大的语言 AI,将一张粗糙的、由数学生成的地图进行打磨,使其成为一个高效的指南,用以应对未来的灾难。


问题所在:“破碎地图”引发的混沌

想象一个巨大的、纠缠在一起的毛线球,每一个结都是一个警报。当一个结被拉动时,它会带动其他的结。要修复系统,你需要找到第一个被拉动的结。科学家们试图通过使用算法从历史中学习毛线模式来解开这个难题。他们称之为“因果图”(Causal Graph)——一种展示哪个警报导致哪个警报的高级说法。

然而,这些仅靠数学生成的地图往往很混乱。它们可能会在两个实际上从未有过联系的警报之间画一条线,或者可能漏掉了一条秘密的捷径。更糟的是,这些地图通常是“固定”的。一旦计算机画好了地图,它就会固守不变,即使人类专家看着过去的灾难说:“不,那不是原因;而是这个!”旧的方法会忽略专家的声音。

解决方案:EvoCause,“地图精炼师”

该论文的作者介绍了一个名为 EvoCause(Evolve Causal Graph,进化因果图)的新系统。把 EvoCause 想象成一位出色的编辑,他拿着一份地图的草稿并不断重写,直到它对这项任务尽可能准确,而他使用的特殊工具是:大语言模型(LLM)。

以下是他们方法中的故事展开过程:

  1. 初稿阶段(第一阶段): 首先,系统使用标准的数学工具绘制一张基础地图,展示警报是如何相互触发的。这张地图是一个好的开始,但并不完美。
  2. 专家评审阶段(第二阶段): 现在奇迹发生了。系统查看了一堆人类专家已经给出结论(“这就是真正的根因”)的过去灾难案例。它将专家的答案与粗略地图的预测进行对比。
    • 不匹配情况: 如果地图说“警报 A 导致了坠毁”,但专家说“不,警报 B 才是罪魁祸首”,系统就知道地图错了。
    • LLM 的职责: 系统并不仅仅是删除地图,而是请求一个超级聪明的 AI(LLM)来提出修改建议。AI 会观察这种不匹配以及警报的名字(如“服务器过载”或“网络延迟”),然后说:“啊!也许我们需要画一条从 B 到 A 的线,或者删除从 A 到 C 的线。”
    • 安全检查: 由于 AI 的建议属于大胆的猜测,因此一个严格遵循规则的计算机程序会对它们进行检查。它确保新的地图不会产生不可能的循环(例如 A 导致 B,B 导致 C,且 C 导致 A),并确保名称匹配。如果建议是安全的,地图就会得到更新。
  3. 最终地图: 系统会重复这个过程,尝试不同的编辑,直到找到那张最符合专家过去诊断结果的地图。需要注意的是,专家的反馈通常是将可能性缩小到一组优秀的地图,而不是指向单一的“完美”地图。EvoCause 寻找的是那张对任务效果最好的地图。

结果:一张更聪明的地图

作者通过两种方式测试了这个想法:一种是使用已知“真实答案”的模拟数据,另一种是使用来自印度尼西亚大规模电信网络的真实数据。

在模拟数据上:
他们创建了 10 个具有已知规则的虚拟世界。当他们从一个基础数学地图开始并让 EvoCause 进行精炼时,结果令人印象深刻。系统的表现变得更好,能更准确地找到真实的根因。

  • 它将找到正确根源警报的准确率提高了 11.59 个百分点
  • 它将针对特定事件找到整个正确根因集合的准确率提高了 9.40 个百分点
  • 它还使地图本身变得更加准确,减少了错误线条的数量。

在真实数据(TeleRCA)上:
作者还发布了一个新的大型数据集,称为 TeleRCA,其中包含来自 5,621 个资源194 种不同警报类型485,681 个警报事件。这是一个真实的、充满网络混沌的宝库。

  • 当他们将 EvoCause 应用于这些真实数据时,提升甚至更大。从一个基础地图开始,他们将找到正确根源警报的准确率从 65.18% 提升到了 92.58%
  • 他们还测试了 AI 是否需要知道警报的名称(如“CPU 过热”),或者仅仅使用数字是否可行。他们发现,了解名称确实有帮助!当他们隐藏名称并使用匿名 ID 时,准确率下降了 6.12 个百分点。这表明 AI 利用警报名称的含义来做出更聪明的关于如何修复地图的猜测。

这意味着什么

这篇论文表明,我们不必在“纯数学”地图和“纯人工”猜测之间做选择。通过将两者结合,我们可以得到更好的结果。LLM 扮演着创意编辑的角色,根据人类反馈建议如何修复地图,而严格的计算机程序则确保地图保持逻辑性。

至关重要的一点是,一旦地图经过精炼,系统就不再需要 AI 或人类专家了。它只需使用最终打磨好的地图,即可瞬间预测出新的根因。这就像是通过展示过去的事故来教学生交通规则;一旦他们学会了,就可以独立驾驶,不再需要副驾驶座上的老师。

作者谨慎地指出,他们并没有“解决”一切。他们发现专家的反馈通常是将可能性缩小到一组优秀的地图,但不一定会指向单一的“完美”地图。然而,他们的方法找到了一张在执行修复网络任务方面表现极其出色的地图,使其成为了保持我们互联世界顺畅运行的强大新工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →