← 最新论文
💻 computer science

CelerLog: Fast Log Parsing via Dynamic Routing

CelerLog 是一款快速高效的日志解析器,它采用动态路由机制将日志分类为统计组和语义组,利用高效的统计方法处理大多数重复模式,同时保留大语言模型推理用于复杂情况,从而在显著降低延迟和成本的同时,相较于现有最先进方法实现更优越的性能。

原作者: Shiwen Shan, Yintong Huo, Minxing Wang, Zhiying Wu, Yuxin Su, Zibin Zheng

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Shiwen Shan, Yintong Huo, Minxing Wang, Zhiying Wu, Yuxin Su, Zibin Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家庞大而混乱的图书馆的经理,每秒都有数百万本书(日志消息)由不同的作者撰写。你的任务是将这些书分类到整齐的类别中,以便日后查找特定信息。这个过程被称为日志解析

本文介绍了一个名为CelerLog的新系统,它解决了一个主要问题:如何在保持准确性的同时,快速且低成本地对这些书进行分类。

以下是其工作原理,使用简单的类比说明:

问题:“一刀切”的错误

过去,对这些书进行分类有两种方法:

  1. 快速机器人(基于语法):这个机器人速度极快。它观察单词的形状,并根据模式进行分类。然而,它有点笨。如果一本书包含奇怪、复杂的句子,机器人就会感到困惑并犯错。
  2. 睿智的教授(基于大语言模型 LLM):这是一位超级智能的 AI 教授。它能理解任何句子的含义,无论多么复杂。它从不出错。但有一个陷阱:这位教授速度慢,雇佣成本高,而且容易疲劳。如果你让教授阅读图书馆里的每一本书,那将耗时极长且费用惊人。

洞察:并非每本书都需要教授

论文作者在观察图书馆时发现了一些有趣的现象。

  • 98% 的书非常重复。它们说的都是同一件事,只是数字或名称不同(例如,“用户 John 登录”、“用户 Mary 登录”、“用户 Bob 登录”)。这些是稠密组
  • 只有 2% 的书是独特的、奇怪的或一次性的事件,不遵循任何模式。这些是稀疏组

作者意识到:为什么要雇佣昂贵且缓慢的教授去阅读那 98% 只是重复的书呢? 快速机器人可以轻松处理这些。教授只应被召来处理那罕见的、令人困惑的 2%。

解决方案:CelerLog(智能交通警)

CelerLog 就像图书馆入口处的动态交通警。它使用“动态路由”系统来决定每本书的去向:

  1. 登记(路由):当书籍到达时,交通警快速扫描它们。

    • 如果一本书看起来属于一个庞大、重复的人群(稠密组),警员将其挥手送入**“快速通道”**。
    • 如果一本书看起来独特、孤立或奇怪(稀疏组),警员将其送往**“慢速通道”**去见睿智的教授。
  2. 快速通道(统计处理器)

    • 在这里,一个简单、超快的统计工具开始工作。它观察这群重复的书,说道:“好吧,这里每个人都说了‘登录’,除了末尾的名字。让我们把名字替换成空白。”
    • 结果:瞬间完成且免费。
  3. 慢速通道(LLM 处理器)

    • 在这里,睿智的教授(AI)终于开始工作。但由于交通警过滤掉了无聊的内容,教授只需阅读总数的一小部分。
    • 结果:教授保持高效,成本保持低位,复杂的书籍得到完美分类。

结果:双赢

论文在 14 个不同的“图书馆”(数据集)上测试了该系统,发现 CelerLog 是一个游戏规则改变者:

  • 速度:与全程使用教授相比,它快了8 到 18 倍。在某些情况下,它甚至比旧的快速机器人快1.5 倍,因为旧机器人试图过于聪明而失败。
  • 成本:它节省了巨额资金。它使用的**“令牌”(支付给 AI 的货币)减少了 80% 到 94%,调用教授的频率降低了86% 到 90%**。
  • 准确性:尽管速度更快,但其准确性实际上高于旧方法。它不会遗漏快速机器人过去遗漏的复杂细节,也不会犯教授在不堪重负时偶尔会犯的错误。

总结

CelerLog 就像一个智能过滤器。它意识到大部分数据都是无聊且重复的,因此用廉价、快速的工具处理这部分。它只为罕见、困难的案例保留昂贵、智能的 AI。这样,你便获得了两全其美的效果:机器人的速度和教授的脑力,却无需支付双倍的代价。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →