Multi-LLM Consensus Framework for Evaluating Banking-Sector NIDS Dataset Coverage of MITRE ATT&CK Techniques
本文提出了一种多大语言模型(multi-LLM)共识框架,用于评估现有网络入侵检测系统(NIDS)基准数据集对银行业特定 MITRE ATT&CK 技术的覆盖程度,揭示了诸如 CIC-DDoS2019 中 89.9% 的盲点等显著差距,并确立了对行业原生数据集的需求,以确保实际运行的有效性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一座繁忙、喧闹的大都市,而银行则是其中最重要的保险库。为了保护这些保险库的安全,被称为“网络入侵检测系统”(NIDS)的保安在数字街道上巡逻,监视着任何试图闯入的人。这些保安通过“演习”进行训练——即被称为“数据集”的海量虚假攻击数据。问题在于,大多数演习都是通用的。它们教会保安如何阻止常见的扒手或汽车窃贼,但很少向他们展示如何阻止那些深谙如何黑进银行特殊转账系统或欺骗自动取款机(ATM)的高手。这就像只训练消防员扑灭厨房火灾,然后就把他们派去扑灭化工厂爆炸一样;他们可能知道如何使用水管,但当化学物质开始发生反应时,他们却不知所措。这篇论文提出了一个简单但至关重要的问题:我们目前的训练演习是否真的在为针对银行的特定、隐蔽攻击做准备,还是仅仅让保安们产生了一种自信,却让他们在现实面前显得脆弱不堪?
本文作者决定通过构建一种更聪明的方法来测试这些训练数据集,从而调查这一差距。他们并没有仅仅计算数据集中有多少个“坏人”,而是使用了一种模拟现实世界安全传感器实际工作方式的方法。他们首先从一份名为 MITRE ATT&CK 的著名指南中,提取了 210 种黑客可能攻击银行的不同方式。然而,他们也深知现实中的安全传感器是有局限性的:它们无法看到加密信息(如一封锁上的信件)内部的内容,无法看到计算机大脑内部正在发生的事情(如文件被删除),并且只能被动地观察流量,就像电线杆上的摄像头一样,而无法对其进行拦截。
为了确定传感器究竟能看到这 210 种攻击中的哪些,研究人员并没有只询问一位专家。他们使用了一个由四个强大的人工智能模型组成的“共识引擎”。你可以把它想象成一个由四位超级聪明的侦探组成的专家小组,他们必须达成一致,才能判定某种特定的攻击是否留下了可见的痕迹。如果四位侦探中有三位说:“是的,我们可以看到那个,”那么这就被计为可检测的。如果他们意见不一,团队会采取谨慎态度,认定该攻击对传感器是不可见的。这一严格的规则将名单过滤到了仅剩 68 种现实中银行传感器能够识别的攻击。
接着,他们拿这 68 种“可检测”的银行攻击,检查了五个流行的训练数据集,以观察它们对这些特定威胁的覆盖程度。结果令人大开眼界。他们发现名为 UNSW-NB15 的数据集表现最好,覆盖了约 82.2% 的重要银行攻击。然而,这里有一个陷阱:其中只有 18.4% 的覆盖率是直接匹配的。其余部分只是模糊的暗示,就像看到了烟雾,却不知道它来自火灾还是烧烤。另一方面,一个常用于测试的名为 CIC-DDoS2019 的数据集在银行安全方面简直是一场灾难。它遗漏了 89.9% 的核心银行行为,留下了一个巨大的盲点。事实证明,这个数据集非常擅长识别大规模、高调的拒绝服务攻击,但在应对黑客用来偷钱的那些微妙、多步骤的诡计时,它完全是无能为力的。
论文指出,依赖这些陈旧、通用的数据集会给银行带来“虚假的安全感”。仅仅因为一个安全系统在通用测试中得分很高,并不意味着当真正的黑客试图操纵 SWIFT 资金转账或劫持 ATM 时,它就能奏效。作者总结道,我们迫切需要专门为银行构建的新型训练数据,包括它们使用的独特语言和协议。在此之前,这些数字保安可能非常擅长识别普通的窃贼,但他们很可能会在那些真正威胁全球金融系统的复杂劫案面前措手不及。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。