TIJERE: A Novel Threat Intelligence Joint Extraction Model Based on Analyst Expert Knowledge
本文介绍了 TIJERE,这是一种新颖的联合实体与关系抽取模型,该模型在多重序列标注框架内利用分析师专家知识和微调后的 SecureBERT+,在网络安全威胁情报领域实现了最先进性能,同时发布了首个公开可用的联合标注数据集 DNRTI-JE,以解决自动化威胁分析中存在的现有差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,正在试图破解一起庞大的网络犯罪案件。你手头有数千份杂乱无章、未经整理的警方报告(威胁情报报告),这些报告混合了技术术语和模糊的描述。你的目标是构建一张巨大且有条理的地图(知识图谱),清晰地展示谁在何时对谁做了什么。
例如,你需要查明"APT29"(一个黑客组织)使用了"Mimikatz"(一种工具)来攻击"XYZ 银行”(受害者)。
本文介绍了一种名为TIJERE的新工具,旨在协助自动化这项侦探工作。以下是其工作原理的简明解释:
问题所在:“流水线”式与“联合”式方法的对比
过去,计算机尝试通过两个独立的步骤(如同工厂流水线)来解决这个问题:
- 第一步:找出所有人名、组织名和工具名(命名实体识别)。
- 第二步:观察这些名称,推测它们之间的关联(关系抽取)。
缺陷:如果第一步出现微小错误(例如将工具误判为人),该错误会传递到第二步,从而毁掉整张地图。此外,网络报告中的句子往往杂乱无章。一个句子可能写道"APT29 使用工具 A 攻击了银行 X",但也隐含了“工具 A 被 APT29 使用”的意思。当相同的词汇在不同角色中出现时,计算机容易混淆哪种关联对应哪种关系。
解决方案:TIJERE(“专家侦探”系统)
TIJERE 通过在一个统一的“大脑”中同时执行这两个步骤来改变游戏规则。但它不仅仅依赖原始文本,而是运用三种巧妙的技巧来像人类专家一样运作:
1. “专家知识”作弊表(专家领域特征)
想象你在阅读这样一个句子:"APT29 使用了 Mimikatz。”
- 普通计算机将"APT29"和"Mimikatz"视为随机单词。由于不知道它们是什么,它可能会认为"Mimikatz"是一个人名。
- TIJERE拥有一份特殊的作弊表。它知道"APT29"是一个黑客组织,而"Mimikatz"是一个工具。
- 类比:这就像给计算机戴上了一副眼镜,高亮显示每个对象的类型。一旦它看到“黑客组织”和“工具”,它就能立即推断出关系很可能是“使用”,因为黑客会使用工具。这防止了计算机因歧义词汇而感到困惑。
2. “荧光笔”(实体掩码)
在包含许多名称的长而复杂的句子中,计算机很难判断哪两个名称在相互关联。
- TIJERE使用数字荧光笔。当它查看"APT29"与"Mimikatz"之间的关联时,它仅高亮这两个词,并将句子中的其他所有内容变为“背景噪音”。
- 类比:这就像老师在拥挤的教室里用激光笔指向两名特定的学生提问,而忽略其他人。这有助于计算机严格聚焦于相关的那一对。
3. “多份副本”策略(多序列标注)
这是本文最大的创新。通常,计算机读取一次句子并试图一次性猜测所有关系。
- TIJERE将一句话处理成针对该句子中每一对可能项目的独立且定制的副本。
- 类比:想象你有一个包含三对嫌疑人的句子。TIJERE 不是让计算机一次性解决整个谜题,而是制作该句子的三个独立副本:
- 副本 A 说:“这里是(APT29, Mimikatz)这一对。它们的关系是什么?”
- 副本 B 说:“这里是(APT29, 银行)这一对。它们的关系是什么?”
- 副本 C 说:“这里是(Mimikatz, 银行)这一对。它们的关系是什么?”
- 通过将问题分解为这些更小、更聚焦的问题,计算机不再因“重叠”的关系而感到不知所措。
特殊词典(SecureBERT+)
网络安全报告使用非常特定的语言(如"EternalBlue"或“鱼叉式网络钓鱼”),普通计算机对此理解不佳。TIJERE 使用一种名为**SecureBERT+**的语言模型的特殊版本。
- 类比:这就像训练计算机使用一本专门为间谍和黑客编写的词典,而不是标准英语词典。这有助于它理解网络世界的“行话”。
结果:新地图与新记分卡
为了证明其有效性,作者做了两件事:
- 构建了一个新数据集(DNRTI-JE):他们选取现有报告,并手动标注了名称及其关系。这是首次公开用于网络安全的此类“联合标注”数据集。
- 测试了模型:当将 TIJERE 与其他方法进行比较时,它无疑是赢家。
- 它正确识别名称(实体)的准确率达到93%。
- 它正确识别关系的准确率达到98%。
总结
可以将 TIJERE 想象为一位超级侦探,它不仅仅阅读报告,还能理解所涉及角色的类型,使用荧光笔聚焦于正确的配对,并将复杂的句子分解为简单的、一对一的访谈。通过将其与专门的“黑客词典”相结合,它构建了比以往任何时候都更准确的网络威胁地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。