RuleForge: Automated Generation and Validation for Web Vulnerability Detection at Scale
本文介绍了 AWS 内部系统 RuleForge,该系统利用大语言模型将结构化的 Nuclei 模板自动转化为 Web 漏洞检测规则,并通过创新的“大模型作为裁判”验证机制与反馈循环,在大规模 CVE 威胁检测中显著降低了误报率并提升了规则质量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 RuleForge 的自动化系统,它是亚马逊(AWS)内部开发的一个“超级助手”,专门用来解决网络安全领域的一个巨大难题:漏洞发现得太快,人工修补和防御的速度根本跟不上。
想象一下,网络安全就像是在守护一座巨大的数字城堡。黑客(坏人)每天都在发明新的“开锁工具”(漏洞,即 CVE),而城堡的守卫(安全团队)需要为每一把新锁制作一把对应的“防盗门”(检测规则)。
以前,守卫们必须手工为每一把新锁制作防盗门。但在 2025 年,新锁的数量暴增(一年超过 48,000 把),守卫们累得连觉都睡不了,根本造不过来。
RuleForge 就是为了解决这个问题而诞生的自动化造门工厂。
1. RuleForge 是怎么工作的?(核心流程)
我们可以把 RuleForge 的工作流程想象成一个**“天才厨师团队”**在尝试做一道新菜(检测规则):
原材料(Nuclei 模板):
以前,研究人员会提供一份标准的“食谱”(Nuclei 模板),告诉厨师这道菜(漏洞)长什么样,以及坏人是怎么偷吃的。RuleForge 就是根据这些食谱来做饭。- 新挑战: 有些食谱只有文字描述,没有具体步骤(非结构化数据),这对厨师来说很难。
5×5 策略(多厨师试菜):
为了不让厨师只凭一次灵感就定稿,RuleForge 每次会派出 5 位厨师,同时尝试做这道菜。而且,如果第一道菜不好吃,每位厨师还有 5 次机会 根据反馈重新调整口味。- 比喻: 就像你让 5 个不同的画家画同一只猫,如果第一张画得不像,就让他们改 5 次,直到画得最像的那张被选出来。
严格的“试吃”环节(验证管道):
做出来的菜不能直接端给客人(生产环境),必须经过五道关卡:- 合成测试: 用假的人(模拟攻击)和假的好人(正常流量)来试吃,看能不能准确分辨出坏人。
- AI 评委(LLM-as-a-judge): 这是本文最创新的地方。我们请了一位**“超级 AI 评委”**(大语言模型),让它像专家一样给这道菜打分。它会问:“这道菜会不会把好人当成坏人抓起来?”(特异性)或者“会不会漏掉坏人?”(敏感性)。
- 真实流量测试: 把菜放到真实的餐厅(50 亿条真实网络流量)里试吃,看会不会引起混乱。
- 信誉检查: 检查这道菜是不是针对那些本来就是坏人的 IP 地址。
- 人类专家终审: 最后,由真正的人类安全专家尝一口,确认无误后,这道菜才能正式上架。
2. 最大的亮点:AI 评委(LLM-as-a-judge)
以前,系统只能告诉你“这道菜通过了”或“没通过”,但没说为什么。
RuleForge 引入了一个**“会讲道理的 AI 评委”**。
- 它的作用: 它不仅打分,还会写“评语”。比如,它会说:“这道菜的辣度(规则)太宽了,会把很多不吃辣的好人(正常用户)误判成坏人。”
- 效果: 这个 AI 评委非常聪明,它能帮助系统减少 67% 的误报(把好人当坏人抓)。它就像一个经验丰富的老饕,能告诉新手厨师哪里做得不对,让厨师在下一次尝试时改进。
3. 遇到的困难与教训
- AI 太自信了: 研究发现,AI 有时候太自信了,明明做错了,它却觉得自己做得很好。
- 解决办法: 我们不再问 AI“你做得对吗?”,而是问它“你哪里可能做错了?”。这种“找茬”的提问方式,让 AI 变得更诚实、更准确。
- 食谱不全: 有些漏洞只有文字描述,没有标准食谱。
- 尝试: 作者尝试让 AI 直接读文字描述来做饭。虽然目前成功率只有 40%,但这证明了未来 AI 可以处理更复杂的“非标准”信息。
- 多面手尝试: 目前 RuleForge 主要处理“网页攻击”(HTTP)。作者还尝试让它变成一个“全能特工”,能处理电脑进程、DNS 等各种类型的攻击,虽然还在实验阶段,但前景很好。
4. 最终成果
- 效率爆炸: 在 2025 年的最后四个月,RuleForge 的生产效率是人工的 336%。也就是说,一个 AI 团队干了一个人类团队三倍多的活。
- 质量更高: 虽然做得快,但并没有牺牲质量。通过"AI 评委”的严格把关,误报率大幅下降。
- 人机协作: 这不是要取代人类,而是把人类从重复劳动中解放出来,让他们专注于最关键的决策和复杂问题的处理。
总结
RuleForge 就像是一个拥有“无限精力”且“善于自我反省”的自动化安全工厂。
它利用 AI 技术,把原本需要人类专家几天才能完成的“制作防盗门”工作,缩短到了几分钟。它通过**“多厨师试菜”和“会讲道理的 AI 评委”**这两个核心绝招,确保了造出来的门既快又准,既不会漏掉坏人,也不会误伤好人。
这篇论文告诉我们:在网络安全这个“军备竞赛”中,单纯靠人海战术已经行不通了,必须依靠自动化 + 人工智能 + 人类专家智慧的完美结合,才能守住数字世界的安宁。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。