Constructing Multi-label Hierarchical Classification Models for MITRE ATT&CK Text Tagging
本文介绍了一种用于自动化 MITRE ATT&CK 文本标记的多标签层次分类框架,该框架利用经典机器学习方法实现了高准确率(在战术层级为 94%,在技术层级为 82%),显著优于 GPT-4o,同时消除了对复杂大语言模型架构的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位图书管理员,正试图整理一个关于网络攻击故事的庞大且混乱的图书馆。每当有一个新的故事(即“威胁报告”)传来时,你需要将它归档到特定的类别中,以便其他图书管理员日后查找。
在网络安全的世界里,这种归档系统被称为 MITRE ATT&CK。它就像一个巨大的、分为两层的档案柜:
- 顶层抽屉(战术/Tactics): 它回答的是,“坏人为什么要这样做?”(例如:“他们想窃取密码”或“他们想掩盖行踪”)。
- 底层抽屉(技术/Techniques): 它回答的是,“他们是怎么做到的?”(例如:“他们使用了一种特定类型的钓鱼邮件”或“他们利用了一个特定的软件漏洞”)。
多年来,安全专家们不得不阅读这些报告并手动将它们归档到正确的抽屉中。这既缓慢、枯燥,又容易产生人为错误。这篇论文是关于构建一个机器人助手来为他们完成这项归档工作的。
“自下而上”的构建方式
作者并没有尝试从头开始构建一个庞大且复杂的机器人(这是一种“自上而下”的方法),而是像堆叠积木一样,循序渐进地构建他们的系统。他们从微小的部分开始,只有在确定前一个模块稳固时,才会增加复杂度。
第一步:简单分类器(“单标签”机器人)
首先,他们教给一个简单的机器学习模型如何观察一个句子并猜出一个“为什么”(战术)。他们将这个模型与 GPT-4o(著名的 AI 聊天机器人)进行了对比测试。- 结果: 这个简单的机器人赢了。它的正确率约为 82%,而 GPT-4o 仅为 59%。作者发现,对于这种特定的、结构化的任务,一个简单的经典工具实际上比花哨复杂的 AI 效果更好。
第二步:多标签分类器(“多标签”机器人)
现实生活并不简单;一个句子往往包含多个攻击原因。因此,他们升级了机器人,让它能猜出前 3 个“为什么”,而不仅仅是一个。- 结果: 这将他们的准确率提升到了 94%。
第三步:层级分类器(“全套归档”机器人)
最后,他们教会了机器人同时预测“为什么”和“怎么做”。如果机器人猜出“为什么”是“窃取密码”,它接着会寻找具体的“怎么做”(例如:“键盘记录器”)。- 结果: 这个系统在处理完整的“为什么 + 怎么做”组合时,达到了 82% 的准确率。
“秘诀”(为什么它有效)
作者并没有使用最新的、最昂贵的“生成式 AI”或复杂的神经网络。相反,他们使用了经典机器学习(具体来说是带有“TF-IDF”的“随机梯度下降”)。
可以这样理解:与其为了去超市买菜而建造一辆极其复杂、昂贵的法拉利,他们建造的是一辆非常可靠、高效的自行车。它能更快地完成任务,成本更低,也更容易维修。
他们还添加了一个隐私锁(哈希处理)。想象一下,他们想把这个机器人分享给世界,但又担心分享用于训练机器人的“秘密配方”(数据)。他们想出了一个方法,可以将数据进行加密处理,使机器人可以在不泄露原始成分的情况下进行学习。这使得他们能够安全地向公众发布这个机器人。
“新图书馆”测试
为了测试他们的机器人是否真的聪明,他们不仅在学习过的故事上进行测试,还给它提供了一套全新的、关于金融威胁(针对银行业的特定威胁)的故事,而这些故事是它从未见过的。
- 结果: 起初,机器人感到很困惑(因为新故事与之前的不同)。但当他们只给它进行了一点点针对新故事的训练后,它很快就能正确地进行归档。这证明了该机器人具有灵活性,可以适应新情况,而不需要海量的额外数据。
核心启示
论文的结论是,你不一定需要最昂贵、最复杂的 AI 来解决问题。通过将任务分解为小而易管理的步骤,并使用可靠的经典工具,他们构建了一个满足以下条件的系统:
- 在处理这项特定工作时,比顶尖 AI 聊天机器人(GPT-4o)更准确。
- 运行起来更快、更便宜。
- 可以安全地分享给公众。
- 能够通过极少的额外训练来适应新类型的数据。
他们已将这个“机器人图书管理员”免费发布在 GitHub 上,以便其他安全团队可以使用它来组织自己的网络威胁报告。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。