← 最新论文
💻 computer science

A Neural Screener–Reasoner Framework for Evidence-Grounded Log-Based Anomaly Detection and Explanation

本文提出了一种神经筛选器-推理器(Neural Screener–Reasoner)框架,该框架结合了一个无解析器、线性自注意力检测器与一个检索增强的大语言模型,旨在实现高准确度的日志异常检测,并生成可验证且基于证据的解释,同时有效控制推理成本。

原作者: Chi-Ming Chou, Shang-Kuan Chen

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Chi-Ming Chou, Shang-Kuan Chen

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代计算系统是庞大且互联的网络,驱动着从科学研究到全球金融的一切事物。为了保持这些系统的平稳运行,工程师们依赖于一种被称为“日志”的持续数字记录流。这些日志就像是系统的日记,记录了每一次动作、错误和状态变化,并附带时间戳和消息。当问题发生时——无论是服务器崩溃、文件保存失败还是安全漏洞——这些日志都包含了理解发生了什么现象所需的线索。然而,随着系统变得越来越庞大和快速,这些日志的容量变得令人难以承受。仅仅一天的活动就可能产生数百万行文本,使得人类操作员无法阅读全部内容。几十年来,解决方案一直是构建自动化工具来扫描这些日志,以发现异常,即暗示问题的奇怪模式。但一个显著的差距一直存在:虽然这些工具可以告诉操作员出了问题,但它们往往无法解释原因。它们提供的是一种二元警告,即简单的“是”或“否”,而没有指向触发警报的具体文本行,也没有将当前的错误与过去的故障联系起来。这让工程师们面临着只有红灯却没地图的困境,迫使他们必须手动在数千行文本中搜寻根源。

一个研究小组开发了一种新的框架,旨在弥补这一差距,从简单的检测转向提供有证据支持的解释。他们的方法将问题分为两个截然不同的阶段,非常类似于分诊护士随后由专科医生接手的过程。第一阶段,他们称之为“筛选器”(Screener),是一个快速、高效的检测器,它可以在不需要将日志分解为更小的、预定义的组成部分的情况下扫描原始日志消息。传统方法通常会强制先将日志转化为僵化的模板,这个过程可能会剥离重要的细节或引入错误。这个新的筛选器直接读取原始文本,使用一种精简的注意力机制,使其能够快速且准确地处理长序列数据。在针对代表超级计算机和分布式存储系统的两个主要数据集进行的测试中,该筛选器以近乎完美的准确度识别了异常,正确标记了几乎所有的异常会话,同时忽略了正常活动。它扮演着一个高度可靠的过滤器角色,确保没有任何真实问题被漏掉。

一旦筛选器将某个会话标记为可疑,第二阶段——“推理器”(Reasoner)就会接管,以生成人类可读的解释。推理器并不靠猜测或仅仅依赖其内部知识,而是像一名在档案库中挖掘的研究员一样。它从历史日志数据库中检索过去异常行为和正常行为的具体示例。利用这些检索到的示例作为引导,它构建一份结构化报告,将它提出的每一项主张都链接到当前日志中的特定文本行以及历史示例中对应的行。这确保了生成的解释不仅是一个流畅的故事,更是一个有据可查的论证。为了保证可靠性,一个自动验证器会根据严格的规则检查每一个生成的解释,确保每一行引用的文本确实存在,并且推理逻辑成立。在实验中,该系统生成的每一个解释都通过了这些严格的检查,且人类专家评价其解释的质量高度准确且完整。

研究人员还解决了生成这些详细解释在计算上成本高昂的实际问题。对每一个标记出的异常都运行复杂的推理过程,对于实际应用来说会太慢且成本过高。为了解决这个问题,他们引入了一种智能门控机制,用于决定哪些异常值得进行完整的解释。系统会优先处理那些初始筛选器置信度较低的会话,将昂贵的推理能力集中在那些最模糊或最难理解的案例上。通过这种方式,该框架可以解释绝大多数独特的故障模式,同时使用显著更少的计算资源。研究发现,通过仅解释那些最具不确定性的案例,系统仍然可以覆盖大部分已知的错误类型,在彻底性与效率之间取得了平衡。这项工作证明,构建能够不仅高精度检测问题,还能提供人类操作员快速且自信地修复问题所需的、可追溯且基于证据的推理的自动化系统是可能的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →