Agent-MIRUPD: Operationalizing LLM Agents for Microservices Incident Response Under Performance Degradation
该论文提出了 Agent-MIRUPD,一种基于大语言模型(LLM)的智能体框架,它将可观测性数据与结构化多步推理相结合,以实现微服务故障响应全生命周期的自动化,与现有基准相比,在诊断速度、缓解准确性和 Token 效率方面均取得了显著提升。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
从银行应用到医疗平台,现代数字服务日益依赖于一种复杂的架构,其中单个应用程序被分解为数十个被称为微服务的微小、独立的程序。这些组件运行在容器中,并由一个被称为 Kubernetes 的自动化系统进行管理,该系统充当交通控制员的角色,确保如果其中一个部件崩溃,它会被重新启动,从而保证服务的持续运行。虽然这种设置提供了极大的灵活性,但也创造了一种新的问题:有时,一个服务并不会完全崩溃,而仅仅是变慢或表现异常。这些微妙的问题(通常被称为灰度故障或性能退化)很难被察觉,因为系统在技术层面上仍然是“存活”的,但却无法正常履行其职责。对于人类工程师而言,诊断为什么某个特定服务出现延迟需要筛选海量的日志数据、性能指标和网络追踪,这是一项缓慢、易错且令人精疲力竭的任务。
瑞典乌梅奥大学(Umeå University)和荷兰自由大学(Vrije Universiteit Amsterdam)的研究人员开发了一种新方法来解决这一问题,创建了一个利用人工智能代理来管理整个问题发现与修复过程的系统。该系统并非仅仅寻找明显的崩溃,而是旨在检测服务何时发生退化,弄清其发生的具体原因,并提出修复方案。他们工作的核心是一个名为 Agent-MIRUPD 的框架,它扮演着数字助手的角色,能够像资深工程师一样对复杂情况进行推理,但具备计算机般的处理速度。研究人员在一个模拟真实世界微服务故障(包括服务随时间推移而老化和变慢的情景)的受控环境中测试了该系统,发现它能够高精度地处理整个事件响应周期。
该系统通过将问题解决过程分为四个不同阶段来运作:检测、定位、分析和缓解。首先,代理不断监控系统以观察是否有异常。一旦发现问题,它就会进入第二阶段,即尝试精准定位究竟是哪个服务出了问题。在第三阶段,它会进一步挖掘以理解根本原因,例如内存泄漏或配置错误。最后,在缓解阶段,它会决定采取什么行动来恢复系统。该设计的一个关键特征在于它如何处理不确定性。对于明确的问题(如配置错误的设置),代理可以自动应用修复。然而,对于那些正确方案并不明显的更微妙的问题,系统会暂停并请求人类操作员的批准,然后再进行任何更改。这种“人机协同”(human-in-the-loop)的方法确保了 AI 不会在试图提供帮助时意外使情况恶化。
为了实现这一目标,研究人员为 AI 配备了一套专门的工具,使其能够查询系统以获取特定信息,例如检查正在运行的程序的运行状态或读取错误日志。该系统并非向 AI 输入原始数据,而是通过这些工具提供汇总后的结构化答案,这有助于 AI 在不被信息淹没的情况下进行更有效的推理。此外,系统还采用了“阶段上下文传播”(stage-context propagation)技术,这意味着在一个阶段得出的结论会直接传递到下一个阶段。例如,一旦代理识别出一个有故障的服务,该信息会立即作为分析阶段的起点,从而避免 AI 需要从头开始调查。这种连续性使得系统能够比以往的方法更快地完成诊断过程。
当研究人员将该系统与现有工具和其他 AI 代理进行对比测试时,结果非常显著。在涉及功能性故障(即服务完全失效)的情景中,该系统的准确率高达 90%。对于更困难的性能退化情景(即服务变慢但并未停止),它达到了 85% 的准确率。该系统还证明了自己比竞争对手更快、更高效。它将寻找问题根本原因所需的时间从 244 秒缩短到了 52 秒。此外,它使用的计算资源(以 AI 进行思考的基本数据单位——Token 来衡量)减少了 51.3%。在修复问题方面,与标准基准代理相比,该系统将缓解动作的准确率从 40% 提升到了 70%。
研究还强调了人类监督的重要性。当系统被允许在处理性能相关问题时完全自主行动时,由于这些问题往往有多种可能的解决方案且每种方案都有不同的权衡,系统有时难以选择最佳修复方案。通过引入人类专家来审查并批准提议的操作,系统可以选出更可靠的恢复策略。研究人员发现,当 AI 提供清晰的推理过程且人类操作员验证了该选择时,整体恢复的有效性会随之提高。这表明,最强大的方法不是取代人类工程师,而是为他们提供一个智能助手,处理繁重的数据分析和初步诊断工作,而将复杂修复的最终决策留给人类的判断。
研究人员承认,他们的工作目前仍处于模拟阶段,真实的生产环境要复杂得多。他们计划在实际的工业工作负载中测试该系统,并探索使用更小、更廉价的模型来提高 AI 的效率。然而,目前的发现表明,实现 AI 代理在微服务全生命周期内进行事件响应是可行的。通过将自动化检测与人类监督相结合,该系统为构建更具韧性的数字基础设施提供了一条切实可行的路径,能够应对那些往往在造成重大中断前都难以察觉的、细微且缓慢发生的故障。这项工作表明,只要设计得当,人工智能可以成为维持现代生活关键系统平稳运行的可靠伙伴。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。