← 最新论文
🤖 machine learning

Multi-Source Cybersecurity Logs: An ATT&CK-Labeled Dataset and SLM Evaluation

本文介绍了一个包含 870 个会话的新型多源网络安全数据集,该数据集包含带有细粒度 MITRE ATT&CK 技术标签的系统、网络和浏览器日志,并证明了在该数据上对小语言模型进行微调能显著增强其分类恶意事件和识别攻击技术的能力。

原作者: Abir Ashab Niloy, Ahmed Ryan, Imamul Hossain Rafi, Md Erfan, Md Rayhanur Rahman

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Abir Ashab Niloy, Ahmed Ryan, Imamul Hossain Rafi, Md Erfan, Md Rayhanur Rahman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图在一个繁忙的办公大楼里破解一个谜案。为了抓到小偷,你不能只盯着监控摄像头(网络日志),你还需要检查员工的门禁刷卡记录(系统日志)以及咖啡店或在线商店的收据(浏览器日志)。如果你只看单一来源,小偷可以轻易躲藏起来。

这篇论文关于构建一本极其详尽的训练手册,用于培养电脑侦探,并测试一种新型的“智能助手”(称为小语言模型,Small Language Model)是否能通过这本手册学会识别小偷。

以下是他们工作的拆解,使用了简单的类比:

1. 问题所在:“盲人侦探”

目前的计算机安全数据集就像是只给了侦探一张停车场地图。它们会错过大楼内部发生的事情(系统日志)或者一个人在电脑屏幕上查看的内容(浏览器日志)。

  • 差距: 现有的数据要么缺失浏览器活动,要么缺失系统活动,或者只是简单地标注“坏人”或“好人”,而没有解释如何实施攻击(例如,他们使用了哪种具体的撬锁技巧)。
  • 目标: 作者希望创建一个能够捕捉所有同时发生的事情(系统 + 网络 + 浏览器)的数据集,并将每一次恶意行为都贴上来自著名的安全剧本 MITRE ATT&CK 的特定“技术名称”标签。

2. 解决方案:构建“谜题模拟器”

作者并没有凭空猜测攻击的样子;他们建立了一个真实的模拟实验室。

  • 设置: 他们搭建了一个安全的、隔离的数字房间(实验室),可以在其中运行真实的恶意软件而不伤害任何人。
  • 角色: 他们运行了 870 个会话(模拟过程)。
    • 800 个会话是“好人”在进行正常的日常工作(浏览网页、写邮件、写代码)。
    • 70 个会话是“坏人”使用真实的黑客工具(如远程访问木马和勒索软件)来窃取数据或锁定计算机。
  • 结果: 他们收集了大约 230 万个事件(如足迹、开门和电话通话)并进行了标注。他们涵盖了 53 种不同的黑客技术,涉及 12 个不同的攻击目标
  • “块”(The Chunk): 为了让计算机易于读取,他们将数据分组成了被称为“块”的小型包。想象一下,一个“块”就像是一个 7 秒钟的视频片段。计算机必须观察这个 7 步的序列,来决定:“这是一个平凡的一天,还是正在发生抢劫?”

3. 测试:训练“智能助手”

他们选取了三个小型、高效的 AI 模型(称为 SLMs——可以理解为聪明但紧凑的助手,而不是那些庞大、沉重的超级计算机),并尝试用他们的新数据集来教导它们。

  • 模型: 他们使用了三种不同的“大脑”:Qwen、Llama 和 Phi。
  • 方法: 他们使用了一种叫做 LoRA 的技术。想象一下,这就像是给 AI 一份专门的速查表或一套带有游戏规则的便利贴,而不是重写 AI 的整个大脑。这种方式既快速又便宜。

4. 结果:从“无知”到“专家”

结果非常显著,就像一夜之间把一个蒙着眼睛的人变成了目光敏锐的侦探。

  • 训练前(“基础”模型):

    • AI 的表现很糟糕。它的正确率只有约 8%
    • 致命缺陷: 这个 AI 是一个“虚报警报”的机器。它过于疑神疑鬼,几乎会将每一个正常的会话都标记为攻击。这就像是一个保安,认为每个走进办公室的人都是小偷。在现实生活中,它是毫无用处的,因为它会产生太多的误报。
  • 训练后(“微调”后的模型):

    • AI 变得非常出色。准确率跃升至 90% 到 97% 之间。
    • 它终于学会了区分正常用户浏览网页与黑客窃取数据之间的区别。
    • 获胜者: Phi-4-Mini 模型表现最佳,成功拦截了 97% 的攻击。其他模型也表现良好,但其中一个(Llama)漏掉了超过一半的攻击。
  • “技术名称”挑战:

    • 虽然 AI 在判断“这是一个攻击”方面做得很好,但在被要求说出确切的特定技术名称时(例如,“他们使用了 T1059.001”),它仍然有些吃力。
    • 最好的模型也只能在 42% 的情况下准确说出确切名称。然而,它在捕捉“大致概念”(部分匹配)方面做得很好,这意味着即使它不能完美拼写出技术术语,它也理解其中的逻辑。

5. 总结

这篇论文证明了两个主要观点:

  1. 数据集是有效的: 你可以通过真实的攻击模拟创建一个高质量的多源数据集,并且其中包含计算机可以学习的清晰模式。
  2. 训练至关重要: 你不能仅仅拿一个通用的 AI 就指望它能抓住黑客。它需要针对特定的安全数据进行“微调”。如果没有这种训练,AI 会因为过于疑神疑鬼而无法使用。有了这种训练,它就能成为安全团队快速处理(分拣)警报的强大工具。

简而言之,他们构建了一个真实的“黑客模拟器”,教了三个小型 AI 助手如何识别坏人,并证明了只要有正确的训练,这些小型助手可以成为非常有效的安全卫士。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →