← 最新论文
🤖 AI

Semantic-Aware Advanced Persistent Threat Detection Using Autoencoders on LLM-Encoded System Logs

本文提出了一种新颖的高级持续性威胁检测方法,该方法利用由自动编码器处理的大语言模型生成的系统日志语义嵌入,通过有效捕捉隐蔽且低速攻击行为的语义意图,在 DARPA Transparent Computing 数据集上展示了优于传统无监督基准模型的卓越性能。

原作者: Waleed Khan Mohammed, Zahirul Arief Irfan Bin Shahrul Anuar, Mousa Sufian Mousa Mitani, Hezerul Abdul Karim, Nouar AlDahoul

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Waleed Khan Mohammed, Zahirul Arief Irfan Bin Shahrul Anuar, Mousa Sufian Mousa Mitani, Hezerul Abdul Karim, Nouar AlDahoul

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一座规模宏大、繁忙喧嚣的城市,每秒钟都有数百万件事情发生:人们行走、汽车行驶、灯光亮起又熄灭、门窗开启。在数字世界中,这座城市就是一个计算机网络,而这些“正在发生的事情”就是系统日志(System Logs)。这些日志就像是城市的监控摄像头和警察报告,记录着程序采取的每一个动作。

问题所在:“草堆里的针”,且看起来还像草
通常,安全系统通过识别“异常”或“罕见”的事物来寻找“坏人”。但这个故事里的坏人是高级持续性威胁(APT)。把他们想象成不是那种大张旗鼓的银行抢劫犯,而是一个顶尖间谍。

  • 他们不破门而入,而是潜入。
  • 他们不奔跑,而是缓慢且安静地行走。
  • 他们利用城市自身的工具(比如清洁工用拖把桶来隐藏武器)来干坏事。

因为这些间谍的行为与普通人如此相似,旧的安全方法(仅仅统计单词出现的频率或寻找统计学上的异常)往往会漏掉他们。这就像试图通过统计有多少人戴着红帽子来在人群中寻找间谍。如果间谍也戴着红帽子,你就会错过他。

解决方案:“翻译官”与“记忆之镜”
该论文的作者构建了一个名为 MPNet-AE 的新系统。他们使用了两种工具来捕捉这些间谍:

  1. 翻译官 (LLM/MPNet):
    与其观察原始、杂乱的计算机代码,该系统首先充当一个“翻译官”。它将枯燥、技术性的日志(例如:“Process 1054 started /bin/bash”)转化为人类可以阅读的自然英语句子
  • 类比: 想象将一份杂货清单变成一个故事:“厨师拿起了刀,开始切洋葱。”
  • 然后,它使用一个超级聪明的 AI 大脑(称为 MPNet,一种大语言模型)来理解这个故事的含义。它为每一个动作创建一个“语义指纹”。这个指纹捕捉的是动作的意图,而不仅仅是单词本身。
  1. 记忆之镜 (Autoencoder/自动编码器):
    接下来,系统使用一种称为**自动编码器(Autoencoder)**的机器学习模型。把它想象成一个只学习“良好行为”的学生。
  • 这个学生被展示了成千上万个正常的、安全的城市活动示例(即“良性”数据)。
  • 学生试图完美地记住这些模式。
  • 当学生看到一个新事件时,他们尝试根据记忆对其进行“重构”。
  • 关键点在于: 如果是一个正常的事件,学生可以完美地重构它。但如果是一个间谍在做一些隐蔽的动作(即使表面上看很正常),学生就会感到困惑并无法准确地重构它。
  • 这种“无法重构”的情况就是警报声。错误越大,说明越可能是间谍。

测试:数字犯罪现场
研究人员使用来自 DARPA 透明计算项目(Transparent Computing project) 的数据对该系统进行了测试。这是一个极其真实的城市受攻击模拟,由“红队”(道德黑客)创建,旨在测试他们是否能攻破系统。

  • 数据极其混乱且极度不平衡:在数百万个正常动作中,只有极小的一部分(不到 0.004%)是真正的攻击。
  • 他们将这个全新的“翻译官 + 镜像”系统与三种旧式方法进行了对比:
    • 孤立森林 (Isolation Forest): 就像试图通过摇晃草堆来寻找针头。
    • OC-SVM: 像是围绕正常事物画一个紧密的圆圈,并将任何在圈外的东西视为坏人。
    • PCA (主成分分析): 像是将一个 3D 物体压扁成 2D 来观察其形状。

结果
新系统以压倒性优势胜出。

  • “翻译官”发挥了作用: 通过理解日志的含义,系统能够分辨出系统管理员重置密码(正常行为)与黑客进行完全相同的操作但带有恶意意图(异常行为)之间的区别。
  • “镜像”抓住了间谍: 该系统识别攻击的准确度(通过名为 AUC-ROC 的评分衡量)始终高于旧方法。
  • 获胜的原因: 旧方法像是通过观察指纹并计数纹路来判断;而新方法则是在观察指纹所讲述的故事。即使间谍试图混入其中,他们的“故事”也与正常城市的“故事”不符,因此被系统识破。

总结
这篇论文表明,要抓住一个隐匿于平庸之中的顶尖间谍,你不能仅仅是计数。你必须理解行为背后的故事。通过将计算机日志转化为有意义的语言,并使用“记忆之镜”来识别不符合常理的故事,我们可以比以往更有效地检测这些隐蔽的、长期的网络攻击。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →