← 最新论文
🤖 AI

GALA: Graph-Augmented LLM Agents for Root Cause Analysis and Incident Response in Microservices

本文提出了 GALA+,一种图增强的 LLM 智能体框架,该框架利用服务依赖图和多模态遥测数据来增强微服务中的根因分析和事件响应,在性能上优于现有基准,并获得了工业界专家的高度认可。

原作者: Yifang Tian, Yaming Liu, Zichun Chong, Zihang Huang, Yiran Li, Hans-Arno Jacobsen

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifang Tian, Yaming Liu, Zichun Chong, Zihang Huang, Yiran Li, Hans-Arno Jacobsen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一座规模宏大、繁忙有序的城市,成千上万家微小的专业店铺(被称为“微服务”)共同协作,运行着一个巨大的在线购物中心。每家店铺都处理一项特定的工作,比如接收订单、检查库存或处理付款。它们通过复杂的电话线路和配送路线不断进行沟通。当一切运转正常时,这座城市运行得非常顺畅。但当出现问题时,情况就会变得极其棘手。例如,“付款店铺”的延迟可能会看起来像是“订单店铺”出了问题,尽管真正的麻烦其实始于数英里之外的“库存仓库”。这就是根因分析(Root Cause Analysis, RCA)的世界。它是工程师为了查明问题究竟始于何处,而非仅仅是出现在何处而进行的侦探工作。传统上,他们使用数学方法来识别数字中的模式(如交通速度),或者查看日志(如警察报告)。但这些方法在面对这座城市的极高复杂性时,往往会感到困惑。最近,科学家们尝试使用大语言模型(LLM)——一种能够阅读并进行推理的超级智能 AI 聊天机器人——来充当侦探。然而,由于缺乏城市布局图,这些 AI 侦探有时会迷失方向、进行徒劳的追查,甚至编造事实(这种现象被称为“幻觉”)。

这就是由多伦多大学研究人员设计的名为 GALA+ 的新框架。你可以把 GALA+ 想象成一组 AI 侦探团队,他们在开始调查之前,会被给予一张详细且严格的城市配送路线图。GALA+ 不会让 AI 在整个城市中漫无目的地游荡,而是强制要求 AI 仅查看与第一个报告问题的店铺相连的特定店铺。这就像告诉一名侦探:“不要检查整个城市;只需检查这家店联系过的三家店铺,以及联系过它的三家店铺。”该系统使用两种不同类型的线索来开启搜寻:一种观察交通的速度和流量(指标/Metrics),另一种则是一个名为 STRIX 的新工具,它通过观察实际的配送路线和时间(追踪/Traces)来发现谁的行为可疑。一旦 AI 有了一份嫌疑人名单,它就会派出专门的代理逐一进行调查,检查它们的日志和性能数据。如果一名嫌疑人看起来是清白的,代理就会转向地图上的下一家店铺;如果他们看起来有罪,调查就会在那里停止。

论文发现,这种“地图引导”的方法是一个游戏规则的改变者。在利用两个不同的模拟城市环境(一个名为 OnlineBoutique,另一个名为 TrainTicket)进行测试时,GALA+ 在第一个数据集上以 74.44% 的比例将真实问题源识别为第一个嫌疑人,在第二个数据集中也达到了 73.33%。这是一个巨大的进步,比排名第二的 AI 方法高出了 25 个百分点以上。研究人员还创建了一种新的评估 AI 报告的方法,称为 SURE-Score,用于检查 AI 的解释对真实的工程师来说是否合乎逻辑。GALA+ 在这项测试中得分最高,证明它不仅能猜对答案,还能解释为什么以及建议具体如何修复。这项研究表明,通过让 AI 侦探专注于服务之间的逻辑连接,而不是让它们自由漫游,我们可以更快地解决数字紧急情况,并大幅减少错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →