✨ 要点🔬 技术摘要
想象一下,你是一名在大型高科技港口担任保安的工作人员。每天,成千上万的警报都会响起:一扇门被打开了、一盏灯闪烁了一下、仓库里传来了奇怪的声音。你的工作是弄清楚哪些警报只是因为一只猫踩到了传感器,而哪些警报意味着真的有小偷正在闯入。
问题在于,现代安全系统(例如这篇论文中提到的系统)使用“超智能AI助手”(大语言模型或LLM)来提供帮助。但这些AI助手有一个坏习惯:它们有时会产生幻觉(hallucinate) 。它们可能会自信满满地告诉你,仅仅因为一个微不足道的故障就要封锁整个港口;或者它们可能会针对一台 Windows 电脑建议解决方案,而实际报警的是一台 Linux 服务器。它们很聪明,但缺乏上下文(context) 。它们不知道港口的历史,并且会被海量的噪音搞混。
于是,有了 DEFENGRAPH。
请不要将 DEFENGRAPH 仅仅视为一种新的 AI,而应将其视为一个与 AI 协同工作的超级强大的图书管理员和侦探 。它为 AI 提供了一个由两种特定类型的记忆构建的“大脑”:
1. 两座图书馆(静态与动态知识图谱)
DEFENGRAPH 构建了一个庞大的、互联的港口安全地图,称为知识图谱(Knowledge Graph) 。它就像一棵巨大的家族树,只不过连接的不是人,而是计算机、警报、黑客和保安。
静态图书馆(历史书): 这部分地图包含了所有始终重要 的信息。它了解港口的布局、常见的攻击模式,以及以往的安全人员是如何解决类似问题的。这是“机构记忆”。
动态图书馆(实时信息流): 这部分是“实时新闻滚动条”。它会随着新警报的到来而实时更新。如果一名黑客目前正试图入侵特定的服务器,这个库现在就能知道这件事。
2. 侦探的处理流程(它是如何运作的)
当新的警报响起时,DEFENGRAPH 是如何协助 AI 的:
第 1 步:搜索(图检索/Graph Retrieval): 系统不再只是靠猜测,而是查看它的地图。它追踪连接关系:“这个警报是关于服务器 A 的。谁与服务器 A 通信?服务器 A 上周发生了什么?之前是否有黑客尝试过这种手段?”它会提取出地图中一小块相关的部分(子图),而不是整个混乱的图书馆。
第 2 步:过滤(LLM 上下文过滤器): 有时,地图提取出的信息包含太多垃圾——比如三年前某个用户更改密码的记录,这与今天的威胁无关。此时,AI 充当一个筛子 ,过滤掉“灰色噪音”,只保留对当前情况真正重要的“蓝色”关键信息。
第 3 步:重排序(推理重排序器/Reasoning Re-ranker): 随后,系统会询问 AI:“在这些剩余的线索中,哪些是目前最 重要的?”它会根据信息的时效性和与当前情境的契合度进行评分。
第 4 步:行动(防御生成/Defense Generation): 最后,AI 利用这些经过清洗、过滤且排序后的信息,为保安编写一份具体的、安全的计划。它不会说“封锁一切”,而是可能会说:“拦截这个特定的 IP 地址,因为它与我们昨天看到的模式相匹配。”
为什么这很重要?
研究人员在“网络靶场(Cyber Range)”中测试了这个系统——这是一个模拟环境,其中一支攻击者团队(红队)试图入侵一个虚构的海运港口,而另一支防御者团队(蓝队)则试图阻止他们。
他们发现,如果没有 DEFENGRAPH,AI 经常出错或给出疯狂的建议(比如因为一个微小的故障就封锁整个网络)。但有了 DEFENGRAPH:
它变得更聪明了: AI 能更频繁地正确识别真实的威胁。
它变得更准确了: 它建议的行动与人类专家的做法相符。
它停止了幻觉: 它不再编造事实,也不会针对错误的操作系统提出修复方案。
简而言之,DEFENGRAPH 通过为 AI 提供一份结构化的过去地图和一份实时的现在信息流,将一个聪明但容易困惑的 AI 变成了一名经验丰富的资深专家 ,确保它提供的建议始终立足于现实。
技术摘要:DEFENGRAPH
问题陈述 大语言模型(LLMs)在网络安全决策方面展现出了潜力,但在高风险、随时间演进的环境中存在关键局限性。具体而言,它们容易产生幻觉,难以进行时间推理,并且缺乏对特定系统上下文的理解。传统的检索增强生成(RAG)方法依赖于表面层级或基于嵌入的相似度,往往会检索出无关文档(例如,检索出一个 Windows 事件工单来应对 Linux 告警),从而干扰 LLM 的推理过程。此外,网络安全数据的信噪比极低,包含大量良性或误导性的日志(例如,错误的密码输入),标准的知识图谱(KG)检索方法无法有效地过滤这些噪声。核心挑战在于创建一个能够将 LLM 输出锚定在长期领域知识和实时演进的事件上下文中的系统,从而提供忠实的、具备时间感知能力的防御策略。
方法论:DEFENGRAPH 框架 作者提出了 DEFENGRAPH ,这是一个双层知识图谱增强的 RAG 框架,旨在为蓝队防御者提供支持。该系统通过以下流程将结构化知识表示与基于 LLM 的生成相结合:
双层知识图谱构建:
静态知识图谱 (SKG): 编码长期基础设施知识、系统架构、典型的攻击者行为,以及源自网络靶场蓝图和文档的历史防御剧本。
动态知识图谱 (DKG): 捕获随时间演进的安全事件、攻击者痕迹以及防御者在实战演练期间记录的工单操作。节点包括告警、工单、IP 和文件,边则编码了时间与语义关系。
基于图的检索过程 (GRP): 在接收到 SIEM(Wazuh)告警后,系统构建查询图,并使用以下方式从 SKG 和 DKG 中检索相关的子图:
基于语义的三元组匹配 (STM): 使用预训练语言模型对查询与知识库之间的三元组(实体、关系、实体)进行编码和匹配。
路径传播评分 (PMC): 聚合来自相邻三元组的特征以计算路径匹配得分,从而识别出最可能的关联路径。
子图组合: 将匹配度最高的路径合并为子图,并通过采样 2 跳邻居来获取周围的上下文环境。
基于 LLM 的上下文过滤与重排序: 为了解决检索到的子图中固有的噪声问题,DEFENGRAPH 采用了两个由 LLM 驱动的模块:
上下文过滤器 (CF): 根据特定的告警上下文评估检索到的路径,对最相关的实体和路径进行评分与选择,从而过滤掉无关的“灰色”节点。
推理重排序器 (Reasoning Re-ranker): 根据路径与告警的相关性及历史知识对其进行重新排序,并引入时间权重分配 (Temporal Weight Assignment) 。该机制为在时间上更接近查询的实体分配更高权重,确保系统优先处理近期且正在演进的威胁。
防御活动生成: 最终经过排序的推理路径被嵌入到 LLM 提示词中,以生成符合人类防御实践的、具备上下文感知能力的缓解策略。
核心贡献
DEFENGRAPH 框架: 一种新型的时间知识图谱 RAG 框架,它结合了静态领域知识与动态、实时的事件数据,以生成具备上下文感知能力的防御策略。
ACDC 网络靶场数据集: 构建并发布了一个全面的网络安全数据集,该数据集源自模拟海事港口环境下的红蓝对抗演练。它包含超过 820 万条防火墙日志、610 万条 Wazuh 告警、326 份事件响应工单以及红队痕迹,代表了一个真实、多噪且异构的数据源。
性能提升: 实验证明,DEFENGRAPH 显著增强了多种模型(GPT-4o, LLaMA-3, DeepSeek-R1, QWen-3)输出的忠实度和可解释性,生成的防御建议与人类编写的基准真相(ground truth)更加一致。
实验结果 该框架在 ACDC 数据集上使用四种领先的 LLM 进行了评估,并与包括 LLM-only、混合 RAG 和 GraphRAG 在内的基准模型进行了对比。主要发现包括:
推理召回率 (RAR): 在 GPT-4o 上,DEFENGRAPH 将推理召回率从 61.45%(仅使用 SKG)提升至 73.49%(全量模型)。在其他模型上也观察到了类似的提升(例如,LLaMA-3 从 46.99% 提升至 61.45%)。
工单动作召回率 (TAR): 系统恢复了更高比例的真实防御动作。在 GPT-4o 上,TAR 从 52.17% 增加到了 72.46%。
精确度与错误率: 虽然精确度(TAP)提升较为温和(GPT-4o 上为 24.49% → 29.24%),但系统保持了较低的错误动作率(低于 4%),其错误主要表现为易于被人类防御者识别的过度反应或误报。
冷启动鲁棒性: 在没有先前工单历史的情景下(重置 DKG),系统仍保持了强大的推理能力,尽管动作召回率有所下降,这凸显了动态上下文对于实现精准动作对齐的重要性。
消融实验: 结果证实了静态和动态知识图谱都是必不可少的;移除 DKG 会导致 TAR 下降约 20%,而移除 SKG 则会导致约 25% 的下降,这证明了历史结构与实时上下文对于系统的必要性。
意义 本文将 DEFENGRAPH 定位为一种先进的、具备落地能力的、具有时间感知能力的网络安全决策支持方案。不同于以往侧重于入侵检测、攻击追踪或威胁情报结构化的基于知识图谱的系统,DEFENGRAPH 直接针对生成可操作的、与工单对齐的缓解步骤 。通过集成双层图谱与基于 LLM 的过滤和重排序,该框架解决了传统 RAG 在多噪、结构化领域中的脆弱性,使 LLM 能够提供既反映静态系统拓扑又反映攻击动态演进的忠实推理。作者断言,这种方法弥合了知识图谱赋能的理解能力与运营层面有效的响应指导之间的鸿沟,为蓝队提供了实用的支持。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。