BARS: Benign-Anchored Ranking and Selection for False Alarm Reduction in Network Intrusion Detection
该论文提出了良性锚定排序与选择(BARS),这是一种计算高效的两阶段特征选择过滤器,通过将评分锚定在良性类均值而非全局均值上,从而在不增加资源开销的情况下,在不平衡数据集上优于现有的非对称方法,减少了网络入侵检测中的虚警。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名大型繁华城市的安保主管。每一秒钟,都有数百万辆汽车、行人以及送货无人机在街道上穿梭。你的职责是识别出隐藏在人群中的坏人——小偷、破坏者或破坏分子。你拥有一套高科技摄像头系统(入侵检测系统)在注视着一切。但问题在于,这套系统过于敏感了,每当送货无人机晃动一下或者行人看一眼手表时,它都会大喊“小偷!”。在这样一座巨大的城市里,即使是极小的错误率也会意味着你的安保团队每天都会收到成千上千个虚假警报。他们会感到疲惫,开始忽视这些警报,而真正的坏人就这样溜走了。这就是网络安全中的“虚假警报”问题:系统将正常的、枯燥的流量误认为是危险的攻击。
为了解决这个问题,科学家们经常尝试教导这些安保摄像头忽略某些细节,比如如果汽车保险杠的颜色对发现罪犯没有帮助,就忽略它。这被称为“特征选择”。然而,大多数传统的处理方法对各类流量一视同仁,就像一位法官在听取被告和控方的陈述时给予同等的权重,尽管其中一方只是一个普通的公民,而另一方是已知的罪犯。一种更新的方法试图通过观察流量偏离平均值的程度来解决问题,但它犯了一个微妙的错误:它使用“所有人的平均值”作为参考点。如果城市里大部分都是罪犯(这在数据中是一种罕见但可能发生的情况),那么这个平均值就会发生偏移,导致系统不再注意到罪犯,因为相对于被扭曲的平均值,他们看起来变得“正常”了。
本文介绍了一种更聪明、更智能的调整这些安保摄像头的方法,称为 BARS(基于良性锚点的排序与选择)。BARS 不再使用混乱的“所有人的平均值”作为参考,而是将其判断严格锚定在“好人”(良性流量)身上。它提出了一个简单的问题:“与正常的、无害的公民相比,这段流量看起来有多像罪犯?”通过这样做,它过滤掉了导致虚假警报的噪音。研究人员在三个具有完全不同的良性和恶意流量组合的数字“城市”上测试了它。他们发现,当数据被攻击淹没时,与之前的最佳方法相比,BARS 将虚假警报减少了约 15% 到 23%,且没有漏掉任何真实的攻击。它是一个轻量级、快速的工具,不需要超级计算机即可运行,非常适合那些已经在警报中挣扎的现实世界安保团队。
被压垮的保安的故事
让我们深入了解 BARS 诞生的故事。在计算机安全领域,存在着被称为**网络入侵检测系统(NIDS)**的系统。把它们想象成互联网的终极保镖。它们站在网络的门口,检查每一个试图进入或离开网络的比特数据。它们的任务是识别“入侵者”——黑客、病毒或数据窃贼。
但有一个巨大的问题。这些保镖通常过于敏感。在一个繁忙的网络中,每天都有数百万个“良性”(正常、安全)的数据包。如果保镖有哪怕 1% 的概率将一个正常的包误认为坏的,那每天就会产生数万个虚假警报。想象一下,一个保安每天大喊 5 万次“着火啦!”。最终,保安会精疲力竭,不再倾听,而真正的火灾却会被忽视。这就是本文所应对的“虚假警报”危机。
旧方法 vs 新方法
为了阻止保镖对着无辜的人大喊大叫,科学家们使用了一种叫做特征选择的技术。把数据包想象成一个走过金属探测器的人。这个数据包拥有数百个“特征”——比如身高、鞋码、走路速度以及携带物品。旧方法试图找出哪些特征对于识别罪犯是有用的。
旧方法的缺陷在于它们是“对称的”。它们将“好人”(正常流量)和“坏人”(攻击)视为就像比赛中的两支不同队伍一样,寻找两者之间的差异。但在现实生活中,“好人”才是基准。他们是世界的常态。而“坏人”是偏离这种常态的异常情况。
一种名为 CMD 的近期方法试图通过观察“坏人”偏离平均值的程度来修复这个问题。但它有一个缺陷。它使用了“全局平均值”(即房间里所有人的平均值)作为其参考点。
- 缺陷: 如果房间里大部分都是坏人(这在某些数据集中会发生),那么“全局平均值”就会发生偏移,看起来更像是一个坏人。突然之间,坏人们看起来不再与平均值有显著差异了!系统停止了标记他们。这就像如果一个房间里到处都是穿着红衣服的人,而你决定“红色”成了新的常态。那么,当一个穿着红衣服的罪犯走进来时,你根本不会注意到他。
引入 BARS: “良性锚点”
本文作者 Abu Fuad Ahmad 和 Istiaque Ahmed 提出了一个聪明的解决方案:BARS。
与其使用(会被扭曲的)“全局平均值”,BARS 使用的是一个良性锚点(Benign Anchor)。它说:“让我们在设定参考点时忽略坏人。让我们只观察正常的、安全的流量,并说:‘这就是正常的样子。’”
以下是 BARS 的运作方式,分为两个简单的步骤:
第一阶段:偏差检查。
BARS 查看每一个特征(比如鞋码或走路速度),并问道:“‘坏人’的平均值与‘好人’的平均值相比有多么不同?”它忽略了全局人群。如果一个特征使得坏人看起来与好人截然不同,它就会获得高分。如果一个特征使他们看起来很相似,它就会获得低分。这确保了系统始终是在测量相对于“常态”的偏差,而不是相对于一个扭曲人群的偏差。第二阶段:“不要重复自己”检查。
有时,两个特征本质上是同一回事。例如,“发送的数据包数量”和“发送的总字节数”可能会同步增减。如果你同时选择了两者,你只是在增加噪音。BARS 会沿着顶层特征列表向下行走,并检查:“这个新特征是否与我已经选中的特征太相似了?”如果是,BARS 就会跳过它。这保持了特征列表的多样性和高效性。
他们的发现
研究人员在三个不同的“城市”(数据集)上测试了 BARS,以观察其表现:
- CICIDS2017: 一个正常流量占多数的城市(类似于真实的办公网络)。
- CICDDoS2019: 一个几乎完全处于攻击之下的城市(一场 DDoS 风暴)。
- UNSW-NB15: 一个混合型城市,但倾向于攻击。
他们将 BARS 与旧的 CMD 方法及其他标准工具进行了对比。
结果:
- 当城市处于攻击状态时(攻击占多数): 这是旧方法失败最严重的地方。由于“全局平均值”被攻击扭曲了,旧方法漏掉了许多坏人。而拥有“良性锚点”的 BARS 看穿了噪音。它在其中一个数据集上减少了 15.4% 的虚假警报,在另一个数据集上减少了 21–23%,同时仍抓住了所有真实的攻击。
- 当城市大部分时间是安全时(良性占多数): 在这种情况下,“全局平均值”和“好人平均值”几乎是相同的。因此,BARS 和旧方法的表现几乎完全一致。这证明了 BARS 并没有破坏任何东西;它只是在问题存在的地方解决了问题。
为什么这很重要
作者谨慎地指出,BARS 并不是解决所有问题的万灵药。还有其他更复杂的方法可以找到更少的虚假警报,但那些方法非常沉重。它们需要大量的计算机内存(在某些测试中超过 1 TB!)并且运行时间很长。
BARS 的特别之处在于它是轻量级且快速的。它以“线性时间”运行,这意味着即使网络变得巨大,它也能轻松扩展。它占用的内存很少。这使得它非常适合现实世界的安全团队,他们需要一个能在标准硬件上立即投入使用的工具,而不需要超级计算机。
简而言之,BARS 是针对特定问题的一个聪明且简单的修复方案:当数据混乱且充满攻击时,不要让“平均值”欺骗了你。坚持关注“常态”是什么样子,坏人就会清晰地显现出来。它提醒我们,有时,寻找异常事物的最佳方法是拥有一幅非常清晰的关于“常态”的图像。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。