← 最新论文
💻 computer science

LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis

本文介绍了 LogDx-CI,这是一个在 35 次真实持续集成故障中评估 11 种日志缩减工具的基准测试,结果表明混合 grep+tail 路由器在成本与质量之间提供了最佳平衡,代理循环以更高成本为代价缓解了上下文质量差异,而跨家族的摘要器 - 调试器配对通过避免自调用偏差,其表现优于同家族组合。

原作者: Bowen Qin

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Bowen Qin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,正试图破解一起案件,但你的“案发现场”并非传统场景,而是一堆庞大且混乱的 20 万页警方报告。你的任务是找出那唯一一句解释工厂机器为何停摆的句子。

如果你试图一次性读完这 20 万页,你的大脑(或者在此情境下,一名 AI“侦探”)会不堪重负、陷入困惑,甚至直接放弃。这正是CI 日志(软件故障的数字记录)所面临的问题:它们体量巨大、杂乱无章,且充斥着大量噪音。

这篇论文,LogDx-CI,是一场宏大的实验,旨在回答一个简单的问题:“将这一大堆文件缩减到可管理规模的最佳方法是什么,以便 AI 侦探能够真正破案?”

以下是他们研究发现的拆解,使用了简单的类比:

1. 问题所在:信息的“消防水龙”

研究人员收集了 35 个真实的软件故障案例。有些日志很小(27 行),但大多数非常庞大(平均 5,000 行,有些甚至达到 20 万行)。

  • 问题:即使是最聪明的 AI 侦探,其一次性阅读能力也是有限的。如果你把整条日志“消防水龙”直接交给他们,他们会溺水。他们需要一个过滤器。
  • 目标:找到一种工具,它能像智能筛子一样,让重要线索通过,同时阻挡噪音,而不会丢弃破案所需的证据。

2. 竞赛:11 种不同的“过滤器”

团队测试了 11 种不同的日志缩减方法。可以将这些方法想象成总结书籍的不同方式:

  • “尾部”方法:只读最后 200 页。(如果答案在末尾,这很好;但如果线索在中间,这就很糟糕。)
  • "Grep"方法:搜索特定关键词(如"Error"或"Failed")并保留这些行。(不错,但有时会抓取过多噪音。)
  • "RTK"方法:一种试图对错误进行分类的专用工具。
  • "LLM 摘要”方法:利用超级智能的 AI 通读全文并撰写摘要。
  • “混合”方法:上述方法的智能组合。

3. 大赢家:“混合”策略

论文发现,最佳方案并非单一工具,而是一种智能组合(即“混合”)。

  • 类比:想象你在干草堆里找一根针。
    • 方法 A(Grep):你用磁铁吸出所有金属。这很有效,但你也会吸出很多锡箔纸(噪音)。
    • 方法 B(尾部):你只看干草堆的顶部。如果针被埋了,你可能会错过它。
    • 赢家(混合):你先用磁铁。如果吸出的金属堆太大,你就切换到一种只抓取最后几把的策略。
  • 结果:排名前两位的“混合”方法在计算机处理能力成本上比标准的"Grep"方法便宜了 4.5 倍,同时在帮助 AI 解决问题方面的效果却一样好。它们在图表上找到了“甜蜜点”,即以最低成本获得最高质量。

4. “智能体”的转折:当侦探拥有工具时

研究人员还测试了如果 AI 侦探不仅仅是一个“一次性”阅读器,而是一个可以寻求更多帮助的智能体,会发生什么。

  • 发现:如果初始摘要很差,一个聪明的智能体可以说:“等等,我需要查看第 4,000 页”,然后去获取它。
  • 崩溃:当允许智能体请求更多信息时,“坏过滤器”和“好过滤器”之间的差异几乎消失了。智能体可以通过追问来修复糟糕的摘要。
  • 陷阱:尽管智能体可以修复糟糕的摘要,但这需要更多的时间和金钱(更多的工具调用)。这就像雇佣一名侦探,他必须往返于图书馆以获取缺失的页面。这行得通,但代价昂贵。

5. “家族偏见”神话破灭

人们曾担心,如果你用 A 公司的 AI 来总结日志,然后用 A 公司的 AI 来破案,它们可能会因为使用相同的语言或具有相似的训练背景而“作弊”。

  • 测试:他们进行了交叉混合。他们用 OpenAI 的摘要工具配合 Anthropic 的侦探,反之亦然。
  • 结果:“家族偏见”并未发生。事实上,混合家族往往效果更好。由一家公司的 AI 生成的摘要,实际上更适合另一家公司的 AI 阅读。这证明摘要的质量取决于信息提取得有多好,而不取决于是谁写的。

6. “自信地错误”的危险

发现有一种特定工具(名为 rtk-log)是危险的。

  • 类比:这就像一名向导自信地把你引向错误的方向。
  • 数据:该工具导致 AI 在约 13% 的情况下自信地犯错。研究人员强烈建议避免使用此工具,因为它会诱骗 AI 编造听起来很好但却是虚假的答案。

建议总结

基于这个“侦探训练营”,作者建议:

  1. 对于快速的一次性检查:使用混合 Grep/尾部方法。它便宜、快速且非常准确。
  2. 对于使用工具的聪明智能体:使用跨家族 AI 摘要(例如,为 Anthropic 侦探使用 OpenAI 摘要工具)。这有助于智能体用更少的问题更快地解决问题。
  3. 避免rtk-log 工具,它经常导致自信但错误的答案。

核心结论:你不需要读完整本 20 万页的小说来解开谜团。你只需要正确的过滤器,向侦探展示正确的 20 页。选对过滤器很便宜,但选错过滤器既昂贵又具有误导性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →