← 最新论文
🤖 machine learning

Context-aware Entity-Relation Extraction for Threat Intelligence Knowledge Graphs

本文提出了上下文感知威胁情报知识图谱(CTiKG)框架,该框架利用融合 SecureBERT+ 嵌入与领域本体的混合自然语言处理模型,克服了现有流水线方法从非结构化网络安全报告中提取准确实体关系三元组的局限性,在符合 STIX 2.1 标准的基准测试上实现了显著的性能提升。

原作者: Inoussa Mouiche, sherif Saad

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Inoussa Mouiche, sherif Saad

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名网络安全侦探,正在试图解开一个巨大的谜团。你拥有成千上万份杂乱无章的手写报告(非结构化文本),其中描述了黑客、他们的工具以及他们的攻击行为。你的目标是将这些杂乱的笔记转化为一个整洁、有序的“通缉令”展板(知识图谱),让你能够瞬间看清谁与谁有关联、他们使用什么工具以及他们在何处发动攻击。

本文介绍了一种构建该展板的更智能的新方法,称为CTiKG。以下是其工作原理,分解为几个简单的概念:

问题所在:“断裂的装配线”

此前,尝试构建这些展板就像运行一条有缺陷的装配线。

  1. 第一步:一个机器人试图识别人名和地名(实体)。
  2. 第二步:第二个机器人试图理清它们之间的关联(关系)。

问题在于,如果第一个机器人犯了错误(例如误判了黑客的名字),第二个机器人也会因此困惑并随之犯错。这被称为“误差传播”。此外,这些机器人是在通用英语(例如阅读维基百科)上训练的,因此它们无法理解特定的黑客俚语或行话。它们读到"Mimikatz"时,会认为这只是一个随机单词,而非特定的黑客工具。

解决方案:“情境感知侦探”(CTiKG)

作者构建了一个新系统,它像一个精通网络威胁语言的特种侦探团队。他们通过以下三个主要方面改进了流程:

1. “超级读者”(更优的实体识别)

他们使用了一个名为**SecureBERT+**的专用大脑,而非基础机器人。你可以将其想象为一位阅读过所有已写成的网络犯罪报告的侦探。

  • 升级之处:他们为这个大脑添加了一张“安全网”(CRF 层)。在旧系统中,机器人可能将某个词标记为“名称开始”,却忘记标记“名称结束”,从而导致句子断裂。安全网确保标签始终相互协调,就像只有当周围拼图块正确时,某块拼图才能严丝合缝地嵌入一样。
  • 结果:该系统在文本中识别 21 种不同类型的“嫌疑人”(如黑客、恶意软件或 IP 地址)的能力大幅提升,错误率降低了约 3–4%。

2. “规则手册”(更优的关系抽取)

一旦找到嫌疑人,系统就需要将线索串联起来。

  • 升级之处:他们创建了一个特定的领域本体。你可以将其想象为一本严格的规则手册或流程图,其中规定:“黑客使用工具”,或“工具针对计算机”。
  • 如何起作用:即使人工智能稍显困惑,规则手册也能充当裁判。如果人工智能试图以不合逻辑的方式将“计算机”与“日期”标记为“关联”,规则手册会予以纠正。这确保了连接(关系)既合乎逻辑又准确无误。
  • 结果:这将线索关联的准确率提高了高达 8%。

3. “训练场”(新数据)

为了训练他们的新侦探,作者并未仅使用旧的杂乱数据,而是创建了一个全新的、超洁净的训练集,名为DNRTI-AUG-STIX2

  • 他们利用现有报告,增加了罕见类型黑客和工具的更多示例(数据增强),以免人工智能因从未见过的事物而感到困惑。
  • 他们还合并了相似类别(例如不同类型的哈希码),使学习过程更加顺畅。

结果:更清晰的画面

作者利用这些新数据集,将新系统与旧系统进行了测试对比。

  • 得分:他们的新系统在 0 到 1 的评分标准上得分显著更高(具体而言,在识别名称方面 F1 分数提高了 3–4%,在识别关联方面提高了高达 8%)。
  • 证明:他们不仅在一类报告上进行了测试,还在三个不同的数据集(DNRTI-AUG-STIX2、DNRTI 和 STUCCO)上进行了测试,以证明无论读取何种类型的网络报告,该系统均能发挥作用。

核心结论

本文并未声称能够阻止黑客或预测未来。相反,它声称构建了一个供安全专家使用的更佳工具。通过修复“装配线”中的错误并教会人工智能讲“黑客语言”,他们创建了一个能将杂乱文本转化为清晰、可靠的网络威胁地图的系统。由于信息准确且易于查询,这份地图有助于安全团队做出更快、更明智的决策。

作者还已在 GitHub 上分享了他们的“训练数据”和“规则手册”,以便其他研究人员利用它们构建更优秀的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →