← 最新论文
💻 computer science

From General Agents to RCA Experts: A Self-Evolving Harness for Root Cause Analysis

本文介绍了 OpsHarness,这是一个自我进化的框架,它通过利用一个能够从过往诊断中积累并验证运维专业知识的自适应外部护栏,显著增强了通用大语言模型智能体的根因分析能力,从而超越了裸通用智能体和专用根因分析智能体。

原作者: Haiyu Huang, Jiewei Lyu, Zhihan Jiang, Jinyang Liu, Xiao He, Tieying Zhang, Wu Xiang, Michael R. Lyu

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Haiyu Huang, Jiewei Lyu, Zhihan Jiang, Jinyang Liu, Xiao He, Tieying Zhang, Wu Xiang, Michael R. Lyu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

当一个复杂的计算机系统开始出现故障时,问题很少会停留在起始点。在现代数字世界中,软件是由成千上万个相互连接的小部件构建而成的。如果其中一个部件踉跄了一下,错误就会向外扩散,导致用户应用出现延迟,或者引发看似完全是另一个问题的突发错误消息。弄清楚问题究竟始于何处,这项任务被称为根因分析(root cause analysis)。几十年来,工程师们一直依赖于这些部件如何连接的地图或统计模式来寻找罪魁祸首。如今,他们越来越多地转向人工智能,特别是大语言模型,让其充当“数字侦探”。这些模型非常擅长阅读日志、理解代码并推理复杂的场景,就像一位读遍了图书馆里每一本手册的卓越工程师一样。然而,这里有一个问题:虽然这些模型很聪明,但它们并不了解试图修复的那个系统的特定特性。它们缺乏人类专家通过反复观察同一个系统的失败与恢复所积累的深厚经验。

香港中文大学和字节跳动的研究人员开发了一种新方法来弥补这一差距。他们并没有尝试为每个系统从头构建一个新的专用 AI,而是创建了一个灵活的外层,包裹在一个强大的通用 AI 周围。他们将这一层称为“护套”(harness)。可以将这个护套想象成一名通用工程师加入新团队时收到的专业工具包和现场笔记。通用 AI 提供推理能力,但护套提供了特定的上下文、正确的工具以及从过去的错误中吸取的教训。他们工作中最重要的创新被称为 OpsHarness,其核心在于这一层是“自我进化”的。它不仅仅是静止存在,它会观察它参与的每一次诊断过程,从成功和失败中学习,并更新自身的指令以不断进步。

团队首先测试了一个常见的假设:即构建一个专门用于故障排除的定制 AI 代理是最佳方法。他们将这些定制构建的代理与仅仅被赋予诊断任务的标准通用 AI 模型进行了对比。结果令人惊讶。那些并未经过专门故障排除训练的通用模型,表现往往优于定制代理。这是因为定制代理通常缺乏通用模型已经掌握的复杂推理和规划能力。然而,即使是最好的通用模型也不完美。由于缺乏对特定系统在压力下表现的了解,它们经常会识别出正确的症状,却指向错误的诱因。例如,模型可能会看到数据库连接突然下降,并假设是数据库故障,但实际上,这种下降只是其他组件(如服务器处理能力耗尽)产生的副作用。

为了解决这个问题,研究人员设计了 OpsHarness,使其成为通用智能与特定系统现实之间的桥梁。该系统分为两个主要部分。第一部分是知识库,它以分层方式存储信息。它始于关于如何调查问题的通用规则,接着添加被监控系统的特定概况,最后累积一套已被证明有效的特定工作流和规则。第二部分是“创意卡”(idea cards)库。与其编写在系统变化时可能会失效的硬编码脚本,不如让护套向 AI 提供一个工具或方法的描述,然后由 AI 在当下编写出使用它的代码。这使得系统能够适应不同的数据布局,而无需重新编程。

OpsHarness 的真正力量在于其从经验中学习的能力。在协助诊断完一个问题后,系统会对整个过程进行回顾。如果诊断正确,系统会将成功的步骤提取出来,转化为可重用的工作流或规则;如果诊断错误,它会识别推理在哪个环节偏离了轨道,并创建一条规则以防止未来再次发生此类特定错误。这个过程并非以一种鲁莽的自动化方式进行;系统设有严格的安全检查。在任何新规则被添加到其记忆之前,都必须在安全隔离的环境中进行测试,以确保它在改进诊断的同时不会破坏其他部分。这种双重检查机制防止了系统学习到坏习惯或对单个异常事件产生过拟合。

研究人员在包含数百个真实故障案例的两个公开基准测试集上测试了这种方法,并在一个大型商业云环境中进行了部署。结果显示了显著的提升。当仅使用通用 AI 模型时,系统正确识别根因的准确率约为 36%。而当同一模型配备了 OpsHarness 后,其准确率跃升至接近 59%。这种提升在不同类型的 AI 模型和不同类型的系统中都是一致的。研究还发现,系统变得越来越好,因为它使用的次数越多就越聪明。在一次连续测试中,随着系统诊断一系列随时间变化的事件,其准确率随着经验的积累稳步攀升。相比之下,没有进化的系统保持不变,而没有安全检查而进行进化的系统则往往会因为学习噪声而导致情况恶化。

研究人员还测量了运行该系统的成本。虽然护套增加了一些额外开销,但它并不需要比使用通用 AI 模型显著更多的计算能力或时间。事实上,通过引导 AI 快速走上正确的路径,它通常能减少 AI 解决问题所需的步骤。包括所有学习到的规则和工具在内的整个系统占用的存储空间非常小,这使其在实际应用中非常实用。

这项工作表明,我们在构建处理复杂任务的智能系统时,思维方式正在发生转变。与其为每个特定工作从头训练一个新的 AI,更有效的路径可能是采用一个强大的通用 AI,并为其包裹一个智能且不断进化的外层,从而教会它环境的具体细节。通过专注于这个外部层,研究人员创造了一个能够将通用模型的原始智能转化为专业专家的系统,该系统能够从自己的历史中学习,并从协助解决的每一次事件中不断进步。研究结果表明,自动化故障排除的未来可能不在于更聪明的模型,而在于更聪明的教学方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →