← 最新论文
💻 computer science

FAME: Failure-Aware Mixture-of-Experts for Message-Level Log Anomaly Detection

FAME 是一个标签高效的混合专家框架,它利用单次离线大语言模型标注过程来训练轻量级本地模型,以实现高精度的消息级日志异常检测,在显著降低标注成本的同时,有效识别异构系统中的各类故障。

原作者: Huanchi Wang, Zihang Huang, Yifang Tian, Kristina Dzeparoska, Hans-Arno Jacobsen, Alberto Leon-Garcia

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Huanchi Wang, Zihang Huang, Yifang Tian, Kristina Dzeparoska, Hans-Arno Jacobsen, Alberto Leon-Garcia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家庞大、全天候(24/7)工厂的经理。每一秒,成千上万台机器都在源源不断地吐出描述其运行状态的小纸条(日志消息)。大多数纸条上写着“我很好”或“我正在正常工作”,但偶尔会有纸条写着“我坏了!”或“出问题了!”

问题在于,你每天会收到数百万张这样的纸条。如果你试图阅读每一张,你会发疯。如果你尝试成批阅读(例如“最后 100 张”),你可能会发现问题,但无法知道哪一张具体的纸条触发了警报。为了找到那张“我坏了”的纸条,你不得不手动筛选数百张“我很好”的纸条。这既缓慢、昂贵,又令人沮丧。

本文介绍了FAME,这是一个新系统,旨在无需人工阅读数百万行日志的情况下,瞬间定位确切的“坏”纸条。

以下是 FAME 的工作原理,通过简单的类比进行解释:

1. 问题:“一刀切”的陷阱

大多数现有系统就像一个过度劳累的保安,试图在 1000 万人的 crowd 中找出小偷。他们观察人群群体。如果某个群体看起来可疑,他们就会标记整个群体。但要找到真正的小偷,你仍然必须盘问该群体中的每一个人。

此外,“小偷”(错误)有多种不同的形式:损坏的内存芯片、网络故障、软件崩溃。试图训练一个保安同时识别所有这些不同类型的犯罪极其困难,且往往会导致错误。

2. 解决方案:“专家团队”(混合专家模型)

FAME 通过雇佣一个专家团队而非一名通才来改变游戏规则。

  • 概念:想象一家医院。与其让一名医生同时诊断心脏病发作、骨折和流感症状,不如拥有一名心脏病专家、一名骨科医生和一名病毒学家。
  • FAME 的做法:它将数百万条日志消息分割成不同的“故障域”(类似于不同的医疗科室)。
    • 一位专家只关注“内存错误”。
    • 另一位只关注“网络故障”。
    • 另一位关注“软件崩溃”。

因为每位专家只专注于一种特定类型的问题,他们变得极其擅长发现此类问题。

3. “智能前台”(路由器)

你不能将每一张纸条都发送给每一位专家;那将是混乱的。FAME 使用一个智能前台(一个轻量级 AI 路由器)。

  • 当新的日志消息到达时,前台瞥了一眼,说道:“这看起来像内存问题”,并立即将其发送给内存专家。
  • 如果看起来像网络问题,它就将其发送给网络专家。
  • 如果看起来像正常的“我很好”消息,它就将其发送到“通用正常”箱中。

这一切在毫秒级内完成。前台不需要是天才;它只需要知道打开哪扇门。

4. “一次性头脑风暴”(利用大型 AI)

这里是巧妙之处。你如何决定雇佣哪些专家以及他们的职位名称是什么?

  • 旧方法:你可能会尝试从头训练整个团队,这需要阅读数百万个标记好的示例(人工阅读并将每张纸条标记为“坏”或“好”)。这既昂贵又缓慢。
  • FAME 的方法:你只需在离线状态下,一次性召集一位超级智能 AI(大型语言模型)
    • 你向超级 AI 展示几个不同类型的错误示例。
    • 超级 AI 说:“好的,我看到了模式。让我们创建一个‘内存错误’团队、一个‘网络错误’团队等。”
    • 超级 AI 绘制工厂地图并分配角色。
    • 关键的是:一旦地图绘制完成,你永远不再调用昂贵的超级 AI。你让超级 AI 当天下班。

从那时起,工厂完全依靠廉价、快速、本地的专家团队和前台运行。

5. “少样本”技巧(节省标签成本)

通常,要训练一位专家,你需要成千上万个“坏”纸条的示例。FAME 使用了一种统计技巧。

  • 如果你查看特定类型的日志消息(“模板”)并看到 100 个示例,且所有 100 个都是坏的,你就不需要为此训练一个复杂的检测器。你只需告诉前台:“如果你看到这种类型的消息,它就是坏的。将其发送到坏纸条堆中。”
  • 如果 100 个示例是混合的(有些坏,有些好),那么你才为该特定组训练一个小型的本地检测器。
  • 结果:FAME 不需要人工标记 470 万行,而只需要人工标记约53,000 行(减少了 76 倍)。这就像雇佣人工只检查产品线的几个样本,而不是检查每一件物品。

6. 结果:快速、廉价且准确

  • 速度:在标准计算机上,它每小时可处理超过 100 万行日志。
  • 成本:设置和运行成本约为10 美元(主要用于那一次性的 AI 头脑风暴)。相比之下,使用大型 AI 检查每一行,每次运行的成本高达数千美元。
  • 准确性:在真实的超级计算机数据集上,它发现了 98% 的错误,且误报极少。它甚至通过根据消息内容猜测它们属于哪个“专家”,发现了以前从未见过的日志类型中的错误。

总结

FAME 就像建立了一条高效的工厂检查线。与其雇佣一个巨大的、昂贵的机器人来阅读每一张便条,不如:

  1. 请一位聪明的顾问一次性设计工作流程。
  2. 雇佣一支廉价、快速、本地的专家团队,他们只关注一种特定类型的问题。
  3. 使用一个简单的接待员将便条分类到正确的专家手中。

其结果是一个运行快速、成本低廉、仅需极少人工训练数据,并能立即定位确切故障部件的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →