Evaluating LLM Generated Detection Rules in Cybersecurity
本文介绍了一个开源评估框架和基准指标,旨在通过使用留出集方法将大语言模型生成的网络安全检测规则与人工生成的规则进行对比,从而评估其有效性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一座巨大且繁忙的城市,每一封电子邮件都是通过邮政系统传递的一封信件。在这座城市里,有一些坏人试图混入伪造的信件、诈骗信息和伪装成友好便条的病毒。为了阻止他们,我们雇佣了“侦探”来编写特定的规则以识别这些捣蛋鬼。例如,一条规则可能会说:“如果一封信来自可疑地址且带有奇怪的附件,请标记它!”这些规则就是我们数字城市的保安。
长期以来,只有人类侦探才能编写这些规则。他们研究数以千计的信件,学习行业诀窍,并编写精确的指令来抓捕坏人。但最近,一种新型侦探来到了:人工智能(AI)。这些 AI 代理就像是超级快速的学徒,能够阅读指令并在几秒钟内编写自己的规则。大家心中最大的疑问是:这些 AI 学徒真的能胜任这份工作吗?还是说它们只是在编写听起来很聪明、但实际上无法抓住真正的罪犯,或者更糟——开始对着无辜的人大喊“着火了!”的规则?这正是来自 Sublime Security 的研究团队想要解决的谜题。他们想看看 AI 是否能像人类专家一样编写安全规则,如果可以,维持这个 AI 运行需要多少成本。
这篇论文介绍了一种测试这些 AI 侦探的新方法,重点关注一个名为 ADÉ(发音为“Ah-Day”)的特定 AI 代理。ADÉ 的设计目标是观察一封恶意电子邮件,并编写一条规则来捕捉未来类似的恶意邮件。研究人员不仅询问“它是否奏效?”,还建立了一个详细的评分系统来衡量三件事:规则捕捉恶意邮件的能力(准确性)、规则在黑客改变微小细节时失效的可能性(鲁棒性),以及让 AI 编写出一条有效规则所需的资金(经济成本)。
为了测试 ADÉ,研究人员与人类编写的规则玩了一场复杂的“捉迷藏”游戏。他们从 Sublime Security 收藏的优秀人类规则列表中,秘密地从 ADÉ 的记忆中隐藏了一条规则。然后,他们向 ADֶ 展示了一封原本应该被该隐藏规则捕捉到的恶意邮件,并问道:“你能写一条规则来捕捉这个吗?”在 ADÉ 写出规则后,研究人员使用一个包含 45,000 封电子邮件的海量数据库,将它的规则与原始的人类规则进行了对比。
结果呈现出一种令人印象深刻的技能与可以理解的局限性并存的状态。在编写难以被欺骗的规则(鲁棒性)方面,ADÉ 的表现出奇地好,得分几乎与人类专家持平。例如,在涉及隐藏 JavaScript 代码的邮件测试中,ADÉ 编写的规则与人类编写的规则一样难以被绕过。然而,ADÉ 要谨慎得多。人类专家编写的是基于多年经验、旨在捕捉数千封恶意邮件的广泛规则,而 ADÉ 编写的则是基于它所看到的单封邮件的非常狭隘的规则。因此,ADÉ 捕捉到的恶意邮件总量(真阳性)较少,但误报好邮件(假阳性)的情况也少得多。事实上,对于某些测试,ADÉ 的规则实现了零误报,而人类的规则有时会标记一些无辜的信息。
研究还调查了使用 AI 的“成本”。编写规则并不是免费的;每当 AI 尝试编写代码却失败时,运行计算机都需要花钱。研究人员发现,ADÉ 通常只需要 1 到 3 次尝试就能编写出通过技术检查的规则。这转化为非常低的成本,根据任务复杂程度,每条成功规则的成本大约在 1.51 美元到 5.13 美元之间。有趣的是,AI 倾向于比人类作者编写更详细的注释来解释其逻辑,这使得规则更易于阅读。
最终,这篇论文表明,像 ADÉ 这样的 AI 代理正变得有能力编写高质量的安全规则,特别是在避免误报和控制预算方面。然而,它们还没有完全准备好取代人类专家。因为 AI 一次只能看到一封邮件,它很难编写出人类在研究了数千个案例后所创造的那种广泛且具有概括性的规则。研究人员得出结论,虽然 AI 是一个可以高效处理特定任务的强大工具,但最好的安全保障来自于一种伙伴关系:由 AI 处理繁重的规则编写工作,而人类专家则负责引导策略,以确保规则能撒下更广的网来捕捉威胁。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。