← 最新论文
💻 computer science

Evolution of Log-Based Detection Rules in Public Repositories

本文呈现了对公共仓库中基于日志的检测规则演进进行的首次纵向分析,揭示了规则的变化主要呈现非单调性,反映了在覆盖率与误报之间持续进行的运营权衡,而非向稳定形式的稳步收敛。

原作者: Minjun Long, David Evans

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Minjun Long, David Evans

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图抓住特定类型罪犯的侦探。你写下了一套指令,或者说一个“规则”。也许这个规则是这样写的:“如果你看到一个戴着红帽子且背着蓝色包的人,就拉响警报。”

在网络安全领域,这些“规则”被称为基于日志的检测规则(log-based detection rules)。这些指令是安全团队用来扫描数百万条计算机记录(日志)以寻找坏人的工具。

这篇论文是对这些侦探指令如何随时间演变的长期研究。研究人员观察了两个大型公共库,这些库是安全专家分享规则的地方:一个是 Sigma 项目(一个社区驱动的团体),另一个是 Splunk Security Content(一个经过专业策划的集合)。他们追踪了数千条规则,跨越了近十年的时间,以观察它们是如何演变的。

以下是他们的发现,通过简单的类比进行解释:

1. 规则永远不会“完成”

你可能认为,一旦侦探写好了一条规则,它就会永远保持不变。但研究人员发现,56% 的规则至少被重写过一次

把这些规则想象成制作汤的食谱

  • 最初,你写下一个食谱:“加入盐和胡椒。”
  • 后来,你发现太咸了,所以你改成了:“少加点盐。”
  • 然后,你意识到你忘了加大蒜,于是你又把它加了回去。
  • 接着,你发现大蒜让味道太辣了,于是你又把它去掉了。

研究发现,规则一直在被不断微调。它们并不只是沿着一条直线变得“更好”;它们在不断地增加和删除配料,起伏不定。

2. “跷跷板”效应

最令人惊讶的发现是,这些规则很少会趋于稳定。相反,它们表现得像一个跷跷板

  • A 面(覆盖率/Coverage): 有时,侦探想要抓捕更多的罪犯。他们会让规则变得更宽泛:“如果你看到红帽子 OR 蓝包 OR 绿围巾,就拉响警报!” 这能抓到更多坏人,但也可能会误抓无辜的人(误报)。
  • B 面(误报/False Positives): 然后,侦探会对抓错无辜人的情况感到恼火。他们会让规则变得更严格:“只有当你同时看到红帽子 AND 蓝包时,才拉响警报。” 这减少了误报,但现在你可能会漏掉一些真正的罪犯。

研究发现,大约有三分之一的规则在多年间于这两个方面之间来回摆动。它们并没有找到一个“完美的”中间点并停在那里,而是不断地振荡,试图在抓捕坏人和不因过多的误报而烦扰安全团队之间寻找平衡。

3. 他们是如何研究这些变化的

为了理解这些变化,研究人员不能仅仅观察规则的文本,因为安全专家经常以不同的方式重写相同的逻辑(比如为了听起来更正式而重写句子)。

他们发明了一种特殊的工具,叫做**“谓词图”(Predicate Graph)**。

  • 类比: 想象将一个复杂的句子变成一个家族树状图。
    • “AND”和“OR”这些词变成了分支
    • 特定的细节(如“红帽子”或“蓝包”)变成了叶子
  • 通过对比这些树状图,他们可以观察规则的结构,从而忽略混乱的文本。这使他们能够准确地看到规则何时增加了新的分支、移除了叶子或重新排列了整个树结构。

4. 变化背后的“原因”

研究人员使用了一种人工智能(大语言模型)来阅读这些变化,并推测专家们做出这些改变的原因。他们发现了三个主要原因:

  • “拔河运动”(振荡/Oscillation): 有时,团队无法在“抓捕更多人”和“减少误报”之间做出决定。他们尝试一个版本,觉得不好,于是切换到另一个版本,觉得也不好,于是又切了回来。这就像是在调节一个温度不断波动的淋浴喷头,试图找到完美的温度。
  • “捆绑包”(耦合变化/Coupled Changes): 有时,增加一个用于抓捕的东西,会迫使你必须增加一个用于排除的东西。
    • 例子: 如果你决定捕捉一种新型病毒,你可能会意外地开始捕捉一个看起来很相似的无害程序。因此,你必须在添加该规则的同时,也添加一条规则来排除这个无害程序。两者缺一不可。
  • “翻译丢失”(证据不足/Insufficient Evidence): 有时,规则发生变化是因为它所监控的计算机系统改变了其语言(例如,字段名从 "user_name" 变成了 "username")。规则本身有效,但仅从文本中你无法判断它是在抓捕更多人还是更少的人。这就像改变了一本书的语言;故事没变,但文字变了。

5. 核心结论

这篇论文的主要结论是:安全规则不是静态的蓝图;它们是活的、呼吸着的实体。

它们并不会向一个完美、稳定的形式进化。相反,它们反映了安全团队持续不断的挣扎。他们不断地在以下两点之间权衡:

  1. 不要漏掉坏人。
  2. 不要用误报来烦扰所有人。

论文指出,由于这些规则如此混乱且不断变化,我们需要更好的工具来帮助安全团队管理它们。我们需要能够理解规则逻辑而非仅仅是文本的系统,以及能够帮助团队处理这些艰难权衡、而无需每次都从头重写整个规则的工具。

简而言之:编写安全规则就像是在调收音机。你不断地前后拨动旋钮,试图找到最清晰的信号,但电台信号总是在漂移,所以你必须不断地进行调整。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →