← 最新论文
🤖 machine learning

Evaluating Open-Source LLMs for Multi-Label ATT&CK Technique Classification on CTI Reports

本文通过引入一个包含 2,076 个句子的真人标注数据集,并对七个开源大语言模型进行评估,为复杂非结构化网络威胁情报报告上的多标签 ATT&CK 分类建立了一个新的经验基准,这些模型集体实现的微平均 F1 分数仅为 0.22,表明尽管参数规模与性能之间存在正相关关系,但目前的模型对于生产级部署而言仍然不足。

原作者: Ahmed Ryan, Saad Sakib Noor, Md Erfan, Shaswata Mitra, Sudip Mittal, Md Rayhanur Rahman

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed Ryan, Saad Sakib Noor, Md Erfan, Shaswata Mitra, Sudip Mittal, Md Rayhanur Rahman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名保安,正试图阅读一本由一名混乱的罪犯编写的、长达千页且杂乱无章的日记。这本名为 CTI 报告 的日记并不仅仅说“我偷了车”,它还会说:“我撬开了锁,启动了引擎,开车去了银行,然后抹除了监控摄像头的记录。”

你的工作是阅读每一句话,并根据一本名为 MITRE ATT&CK 的庞大规则手册,为每一句话贴上正确的“犯罪代码”标签。这本手册包含了每种可能的攻击方式共 211 种不同的代码。问题在于,一个句子往往同时包含多个犯罪行为,而且语言表达非常复杂。

长期以来,计算机在这方面表现得很糟糕。它们就像是一个只能阅读简单、单句笔记的机器人。如果笔记很复杂,机器人就会感到困惑。

后来出现了 大语言模型 (LLMs)。你可以把它们想象成超级聪明、博学多才的实习生,能够理解上下文和细微差别。人们曾希望这些 AI 实习生终于能够读懂这些混乱的日记,并完美地标记出犯罪行为。

这篇论文就是这七位“开源实习生”的成绩单。 研究人员想要看看这些 AI 实习生是真的准备好胜任这份工作了,还是仍然太过于缺乏经验。

以下是他们所做的工作以及他们的发现,通过简单的语言进行了解释:

1. 测试:一场“现实世界”的考试

之前对这些 AI 实习生的测试就像是给他们做一些简单的、只有一个答案的填空题(例如:“罪犯使用了钥匙。” -> 标签:撬锁)。

这篇论文的研究人员说:“现实生活并不是这样的。”他们创建了一个更难、更真实的考试

  • 他们提取了 83 份由人类专家编写的真实且杂乱的安全性报告
  • 他们将这些报告拆解成了 2,076 个独立的句子
  • 他们让专家手动为每个句子标注正确的犯罪代码。有些句子没有代码;有些有一个代码;有些甚至同时包含多达九个代码!
  • 这成为了用来给 AI 打分的“标准答案”(Ground Truth)。

2. 参赛选手

他们选择了 7 个不同的开源 AI 模型

  • 你可以将这些模型看作是不同规模的学生。有些很小(拥有 80 亿个“脑细胞”或参数),有些则是巨头(拥有 2360 亿个)。
  • 他们在不同的“模式”下进行了测试:
    • 零样本 (Zero-Shot): 只给出指令。
    • 少样本 (Few-Shot): 先给 AI 几个例子让它先学习一下。
    • 思维链 (Chain-of-Thought): 要求 AI 在回答之前进行“大声思考”,即一步步推理。
    • 温度值 (Temperature): 调节 AI 的“创造力”旋钮(0 = 严谨的机器人,0.5 = 略带创意)。

3. 结果:实习生们仍在学习中

结果令人清醒。

  • 得分: 即便是最好的 AI 模型也只得到了 22% 的分数(在以 100% 为完美的量表中)。
    • 类比: 想象一名学生参加了一场很难的期末考试,只得了 D-。他们虽然及格了,但漏掉了大部分答案。
  • 规模很重要(主要是在规模上): 最大、最复杂的模型(“巨头”模型)通常比小的模型表现得更好。存在明显的联系:大脑越大 = 分数略高。
  • “神奇”的设置并没有奏效:
    • 给 AI 提供例子(少样本)并没有真正起到帮助作用。
    • 要求 AI “一步步思考”(思维链)也没有起到什么帮助。
    • 改变“创造力”旋钮(温度值)几乎没有任何影响。
    • 类比: 这就像是给学生换了一支不同颜色的铅笔,或者告诉他们“再努力一点”,但如果他们本身不懂这些知识,分数是不会改变的。

4. 唯一起作用的一件事:“小抄”

研究人员尝试了最后一件事。他们为 AI 设置了 检索增强生成 (RAG) 机制。

  • 类比: 与其让 AI 仅仅依靠记忆,不如给它一本“开卷考试”用的官方规则手册,让它在考试时可以查阅。
  • 结果: 分数从 22% 跳升到了 32%
  • 这是最大的进步。这证明了 AI 失败并不是因为它“笨”,而是因为它手头没有当前的规则。

5. 问题出在哪里?

研究人员观察了 AI 犯下的错误:

  • 误报 (False Positives): AI 看到像“规避 (evade)”这样的词,就猜测是“劫持 (Hijacking)”,尽管该句子其实是在描述其他事情。它是在基于关键词进行猜测,而不是理解整个故事。
  • 漏报 (False Negatives): AI 漏掉了一个犯罪行为,因为它没能理解“部署勒索软件二进制文件 (staging a ransomware binary)”实际上是一种特定的传输类型。它缺乏深层的上下文理解。

总结

论文的结论是:目前的开源 AI 模型尚不足以成为分类复杂网络威胁的唯一“保安”。由于它们的准确性太低(得分仅为 22%-32%),在没有人类帮助的情况下,无法被信任用于现实世界的安全中心。

唯一显著提高它们表现的方法,是在测试期间为它们提供官方规则手册(RAG)。仅仅通过改变提问方式(提示词)或扩大模型规模,并不能解决核心问题。

简而言之: 这些 AI 实习生很聪明,但目前由于错误率过高,还无法独立工作。它们需要一名人类监督员和一本参考手册才能正确完成工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →