← 最新论文
💻 computer science

Advanced Persistent Threat Detection via Adaptive Dynamic Masking and Heterogeneity-Aware Projection

本文提出了 AMH-APT,一种通过采用自适应动态掩码策略以保留关键攻击上下文,并利用异构感知投影以维持不同实体类型间独特语义空间的创新型 APT 检测框架,从而在日志级和实体级检测任务中均优于现有方法。

原作者: Jiahao Liang, Xiaofeng Lu, Xinhong Hei, Silin Guo, Danna Zhu, Shibing Gu, Pengcheng Wang

发布于 2026-09-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiahao Liang, Xiaofeng Lu, Xinhong Hei, Silin Guo, Danna Zhu, Shibing Gu, Pengcheng Wang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字世界中,安全系统经常被其必须监控的海量数据所压倒。每一秒钟,计算机都会产生无尽的记录流,详细描述谁访问了文件、运行了哪个程序,或者建立了哪种网络连接。几十年来,防御者一直试图通过寻找特定的、已知的恶意行为来发现入侵者,比如小偷撬锁。然而,一种全新的威胁已经出现,它看起来一点也不像小偷。这些被称为高级持续性威胁(APT)。APT不是一次性的、大张用事的闯入,而是一种长达数周或数月的缓慢、隐蔽的渗透。攻击者将他们的恶意步骤隐藏在日常计算机操作的正常、枯燥的噪声之中,使得区分日常文件更新与秘密数据窃取变得几乎不可能。为了捕捉这些隐形的敌人,研究人员开始将计算机活动的整个历史映射为一个巨大的连接网络,即溯源图(provenance graph)。在这个网络中,每个用户、文件和程序都是一个点,而他们采取的每一个行动都是连接它们的线。目标是在这个庞大且复杂的地图中找到隐藏的微小、可疑的模式。

长期以来,阅读这些地图的最佳工具依赖于一种称为自监督学习的技术。想象一下,一名学生试图通过阅读一本许多单词被遮盖的书来学习语言规则。学生必须根据周围句子的上下文来猜测缺失的单词。如果他们猜对了,就说明他们正在学习语言的结构。在计算机安全领域,研究人员使用类似的方法:他们隐藏部分计算机活动图,并要求人工智能重建缺失的部分。如果人工智能做得很好,说明它已经学会了“正常”行为的表现形式。当它遇到一个新的地图,由于模式错误导致无法重建缺失部分时,它就会将其标记为潜在的攻击。这种方法曾非常有效,但它有一个缺陷。隐藏地图部分的标准方法是随机的;它们在不考虑是否重要的情况下遮盖单词。在计算机系统中,有些动作只是背景噪声,比如程序检查时间,而另一些动作则是事件链中的关键环节,比如用户在建立秘密连接之前打开了特定文件。随机遮盖这些关键环节会留下一个破碎的故事,使得AI难以学习到攻击的真实形态。

西安理工大学的一个研究小组开发了一种新的教学方式,这种方式更加关注重点。他们意识到,计算机活动图中的各个部分并不完全平等。某些节点(代表特定的文件或程序)是故事的核心,而另一些则只是次要细节。他们的新方法被称为AMH-APT,改变了游戏规则。该系统不再是随机地遮盖地图的一部分,而是首先计算每个部分的“重要性”。它观察一个部件有多少个连接,以及它的特征有多么独特。如果一个部件是一个主要的枢纽,或者具有非常独特的行为,系统就会决定让它保持可见。它只隐藏地图中那些不太重要的、带有噪声的部分。这确保了当人工智能尝试猜测缺失的信息时,它是在利用最关键的上下文进行工作,从而在训练过程中保留了攻击路径的骨架。

研究人员还解决了第二个问题:地图上不同类型的对象。计算机系统包含用户、文件、网络连接和进程,它们的行为各不相同。以前的方法试图将所有这些不同的类型挤压进一个统一的空间,这模糊了它们独特的特征。这就像是试图仅用一套关于运动的规则来描述汽车、鸟类和鱼类一样。新方法为每种类型赋予了专门的空间来被理解。当系统隐藏一个文件时,它将其视为一个“隐藏的文件”,而不仅仅是一个通用的“隐藏对象”。这可以防止人工智能利用对象的标签来猜测其内容。通过在保持用户、文件和网络各自独立身份的同时,仍允许它们相互通信,该系统构建出了一个更清晰的运行图景。

为了测试这些变化是否真的奏效,研究人员在五个不同的现实世界数据集上运行了他们的新系统,范围从小型模拟攻击到涉及数千个事件的大型复杂场景。他们将结果与之前依赖随机隐藏的最优方法进行了对比。结果非常明确。新系统能够一致地发现更多攻击,同时产生的错误极少。在一次涉及名为CADETS的大型数据集的具体测试中,旧方法错误地将近2,900次正常活动标记为攻击,引发了大量的误报。新系统将这个数字减少到了仅略高于1,100次,在依然能捕捉到坏人的同时,将误报率降低了一半以上。在另一个名为Wget的测试中,该系统正确识别攻击的能力显著提升,从约94.5%的成功率上升到了接近98.1%。这些改进不仅仅是微小的调整,它们代表了系统学习如何区分日常生活噪声与复杂入侵者隐秘步骤的一次根本性转变。

这种方法的成功在于其平衡了难度与清晰度的能力。研究人员发现,仅仅隐藏固定量的数据是不够的。相反,他们引入了一个进度表,从简单的任务开始(隐藏较少的东西),并随着系统的学习逐渐增加难度。这使得人工智能能够先掌握正常行为的局部模式,然后再挑战去理解定义攻击的复杂、长程连接。通过将这种精细的调度与保护重要节点及尊重不同数据类型本质的策略相结合,该系统学会了既看森林,也看树木。其结果是一个对违规迹象更敏感,且不太可能对无害活动“虚报警报”的检测工具。

这项工作表明,未来的网络安全可能不再仅仅依赖于寻找新的、复杂的规则,而更多地取决于教机器如何“关注正确的事物”。通过理解并非所有数据点都是平等的,以及不同类型的数字对象需要不同种类的理解,研究人员构建了一个更擅长洞察“隐形”的系统。这项研究并不声称已经彻底解决了网络威胁问题,但它提供了一个看待数字活动混沌状态的强大新视角。它表明,通过优化我们教机器从自身历史中学习的方式,我们可以使它们变得更敏锐、更准确、更可靠,成为我们数字世界的守护者。未来的道路在于不断完善这些方法,确保它们能够适应不断变化的攻击手段,同时保持误报率足够低,以便人类防御者能够专注于真正的威胁。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →