想象一下,你正试图绘制一张规模宏大、细节丰富的城市地图,但你并没有蓝图,手里只有成千上万份来自不同人的、杂乱无章的手写日记。其中一些条目清晰明了,一些潦草难辨,一些自相矛盾,还有一些纯属捏造。这正是网络安全专家在尝试将**网络威胁情报(CTI)报告转化为知识图谱(Knowledge Graphs)**时所面临的困境。这些报告描述了黑客、工具及其攻击手段,但它们是以非结构化、杂乱无章的文本形式存在的。
这篇论文介绍了一个名为 TACTIC-KG 的新系统来解决这个问题。以下是该系统的运作方式,我们使用简单的类比来解释:
旧方法:“超级天才”独奏家
此前,研究人员尝试使用一个巨大的、功能极其强大的 AI(“单体”模型)来阅读杂乱的日记,理解故事内容,找出黑客和工具的名字,弄清它们之间的联系,并一次性绘制出地图。
这就像雇佣一位超级天才艺术家独自完成整个工作。
- 问题所在: 即便是天才也会疲惫。当故事太长或太复杂时,这位“超级天才”就会开始产生幻觉。他们可能会凭空捏造两个从未存在过的人之间的联系,或者因为试图同时处理太多事情而遗忘关键细节。
- 成本问题: 这位“超级天才”的雇佣成本极高,且工作速度缓慢。
新方法:“专业化团队”(TACTIC-KG)
该论文的作者提出:“为什么要依赖一个过度劳累的天才?让我们雇佣一支由专业人员组成的精干团队吧。”
TACTIC-KG 将这项工作分解为四个不同的角色,每个角色都由一个更小、更便宜且更专注的 AI 智能体(Agent)来处理。他们按顺序工作,将任务在链条中向下传递:
提取者(搜寻者):
- 职责: 这个智能体只负责观察文本并提取出原始的信息碎片(例如“Pegasus”、“iOS”、“NSO Group”)。它现在还不关心这些东西意味着什么;它只是把看起来有价值的事实抓取出来。
- 类比: 就像一只在地上捡拾闪亮物品的食腐鸟。它抓取所有看起来有趣的东西,而不去判断那是钻石还是一块玻璃。
打字员(标注员):
- 职责: 这个智能体接过搜寻者找到的闪亮物品,并将它们放入正确的框中。它是“Pegasus”这类恶意软件吗?“NSO Group”是一个组织吗?
- 类比: 就像一名图书管理员,接过搜寻者带来的书,并将它们放在正确的书架上(如小说、历史、科学)。
验证者(事实核查员):
- 职责: 这是最关键的新步骤。这个智能体会查看已标注的项目,并询问:“原始日记里真的写了这些吗?”如果搜寻者和标注员做出的判断在原文中缺乏依据,验证者就会将其剔除。
- 类比: 就像一名严格的编辑在核查新闻稿。如果记者声称“嫌疑人在巴黎”,但源文本仅提到“嫌疑人在欧洲”,编辑就会删掉这个过于具体的说法。这能阻止系统编造内容(即防止产生“幻觉”)。
馆长(绘图师):
- 职责: 这个智能体获取经过验证的事实,并将它们连接成一张最终的、干净的地图。它会修正微小的错误,合并重复的名字(例如将“TrickBot”和“Trick Bot”合并),并确保地图在逻辑上是合理的,不会添加虚假的桥梁。
- 类比: 就像一名制图师在绘制最终地图,确保道路连接逻辑合理,并移除那些通往虚无的桥梁。
为什么这个团队更好
论文声称,这种团队协作模式在三个方面优于“超级天才”:
- 更少的幻觉: 由于验证者充当了严格的守门人,团队不会意外发明虚假的联系。相比之下,“超级天才”往往因为想表现得“太乐于助人”而用猜测来填补空白;而这个团队只有在文本明确支持的情况下才会填充空白。
- 更好的召回率(发现更多信息): “搜寻者”被允许抓取它看到的所有东西,即使它并不确定。然后由“事实核查员”来分辨好坏。这意味着他们漏掉真实威胁的可能性更低,而单个模型可能会因为不堪重负而跳过某些细节。
- 更便宜、更快: 他们没有使用一个庞大且昂贵的计算机大脑,而是使用了几个小型、轻量级的“大脑”(参数量在 30 亿到 80 亿之间)。这就像是使用一群高效的实习生,而不是一位高薪且缓慢的高管。
实验结果
当作者在真实的网络安全报告上测试该系统时,他们发现:
- 这支由小型智能体组成的团队在发现和标注威胁方面,比巨大的单体模型更准确。
- 他们构建的地图(知识图谱)更具一致性,且虚假连接更少。
- 他们利用更小、更便宜的计算机模型就实现了这些成果。
简而言之,TACTIC-KG 证明了,对于像绘制网络威胁地图这样复杂的任务,一支组织良好的专业化团队比一个过度劳累的超级巨星更有效。
技术摘要:TACTIC-KG
问题定义
从网络威胁情报(CTI)报告中构建网络安全知识图谱(CSKG)面临着显著挑战,其原因在于源文本具有非结构化、异构性和噪声大的特点。虽然大语言模型(LLM)已被应用于自动化此类提取任务,但依赖单一大型模型的单体式方法往往存在部署成本高、可控性有限以及性能不稳定等问题。具体而言,这些系统在以下方面表现挣扎:
- 幻觉与忠实度: 生成看似合理但缺乏文本支持的三元组(例如,推断文中并未明确说明的攻击者角色或时间联系)。
- 过度补全: 人为强制增加图谱连通性以创建完整的攻击链,即使证据是局部或断裂的。
- 上下文规模权衡: 大上下文窗口会导致轻量级模型的注意力稀释,而小窗口则会导致遗漏错误。
现有的先进系统(如 CTINEXUS)通常依赖于使用超大规模模型(如 671B 参数模型)的上下文学习(ICL)或复杂的检索增强生成(RAG)流水线,这些方法可能较为脆弱、昂贵,且对检索质量高度敏感。
方法论:TACTIC-KG 框架
本文引入了 TACTIC-KG,这是一个代理式(agentic)框架,它将 CSKG 的构建重新定义为一个受控的多阶段推理过程。该框架并非采用单一的单体推理任务,而是利用低秩自适应(LoRA)技术,将工作流分解为专门的、轻量级的 LLM 智能体(3B–8B 参数)。其核心设计原则是**“忠实度优先于连通性”**。
工作流架构
该流水线通过以下阶段处理原始 CTI 报告:
- 语义分块(Semantic Chunking): 长报告在句子或话语边界处进行切分,并带有受控的重叠,以保持局部语义连贯性并防止上下文稀释。
- 提取器智能体(Extractor Agent): 生成严格基于文本块的候选三元组 (h,r,t)。它不进行类型化或全局推理,从而防止过早的抽象。
- 类型化智能体(Typer Agent): 根据局部上下文和关系语义,为实体分配符合本体论(ontology)规范的语义类型(如 MALOnt, STIX 2.1)。它在封闭的标签空间内运行,以防止本体漂移。
- 验证器智能体(Verifier Agent): 作为过滤阶段,执行二分类任务,以确定一个带类型的三元组是被显式或隐式文本证据所支持(SUPPORTED)还是不支持(NOT_SUPPORTED)。它执行闭世界假设,拒绝那些看似合理但文中未说明的关系。
- 策展师智能体(Curator Agent): 执行最终的清洗工作,包括去重、实体归一化(别名解析)以及最小化的结构修复。它仅在逻辑必要且有证据支持时才引入新的边,充当防止幻觉的结构防火墙。
技术实现
- 模型专业化: 该框架利用通过 LoRA 微调的轻量级模型(如 Ministral-3B, Ministral-8B, Qwen3-8B)。这允许使用模块化的、针对特定智能体的适配器,从而降低 GPU 显存占用并实现独立升级。
- 训练策略:
- 提取器 在带有严格 JSON 输出格式的切分报告上进行训练。
- 类型化器 在提示词中嵌入的封闭标签空间下进行训练。
- 验证器 在标注语料库上作为三元组级的二分类器进行训练,以区分支持与不支持的关系。
- 策展师 经过训练以预测最小的桥接三元组集合,用以连接图谱组件而不幻觉出不支持的边。
核心贡献
- 代理式分解: 本文提出将任务从单体生成转向多智能体系统,其中提取、类型化、验证和策展由专门的智能体分别处理。这降低了任务熵并使幻觉风险局部化。
- 忠实度强化: 通过将生成与验证显式分离,并在三元组层面执行闭世界假设,TACTIC-KG 显著减少了幻觉关系和过度补全。
- 高性价比性能: 框架证明了通过 LoRA 进行专业化处理并在多智能体流水线中编排后,轻量级模型(3B–8B)在提取质量和图谱一致性方面可以媲美甚至超越规模大得多的单体模型(如 DeepSeek-V3.1 671B)。
- 本体落地: 系统将本体约束(MALOnt)直接集成到类型化和验证阶段,确保生成的图谱在结构上是一致且可操作的。
实验结果
该框架在人工标注的 CTI 报告(CTI-HAL 和 CTINEXUS 基准测试)上进行了评估,对比对象包括使用各种大模型的 CTINEXUS(DeepSeek-V3.1, Kimi-K2, Devstral-2)。
- 提取质量: TACTIC-KG 实现了更高的 F1 分数并显著提升了召回率,优于单体基准模型。例如,在 TEST2 上,Ministral-3-8B 变体实现了 78 的 F F1 和 63 的图谱相似度,超过了 DeepSeek-V3.1(F1: 66, 图谱: 52)。
- 召回率 vs 精确率: 智能体专业化允许对精确率-召回率权衡进行显式控制。提取器实现了高召回率(高达 90%),而验证器和策展师保持了稳定的精确率,在不牺牲覆盖范围的情况下过滤掉了幻觉。
- 类型化与落地: TACTIC-KG 展示了卓越的类型化准确度(部分类型准确度高达 72%,对比 DeepSeek 的 69%)和更好的语义落地能力,这归功于降低了单个智能体的认知负荷以及本体感知的验证。
- 数据效率: 该框架仅需适度的训练数据(约 200 个块)即可达到强劲性能,事实证明数据的多样性比单纯的规模更为关键。
- 混合设计: 实验表明,使用一个更强的共享推理模型进行验证和策展(同时保持提取环节的专业化)能进一步增强稳定性和一致性。
重要性与主张
本文声称 TACTIC-KG 为 CSKG 构建提供了一种稳健且具成本效益的替代方案,以应对单体 LLM 方法。通过将问题视为受控的多智能体推理过程,该框架:
- 最小化幻觉: 显式的验证和策展阶段防止了未经证实的实体的传播。
- 提高稳定性: 模块化智能体降低了单次通过的大型模型常见的性能波动。
- 支持部署: 轻量级模型的使用使得该系统对于计算资源有限的组织而言是可行的,包括那些对数据隐私要求较高、需要本地化部署的企业级应用场景。
作者总结道,尽管在所有系统中完全的类型化准确度仍是一个挑战,但将任务分解为专门的智能体为构建可操作的网络威胁情报知识图谱提供了精度、稳定性和成本效率之间的卓越平衡。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。