← 最新论文
🤖 machine learning

Noise Contrastive Estimation-based Matching Framework for Low-Resource Security Attack Pattern Recognition

本文提出了一种基于噪声对比估计的神经匹配框架,该框架将 TTP 映射重新表述为语义相似度任务,以解决低资源安全攻击模式识别中面临的大标签空间、分布倾斜以及层级复杂性等挑战。

原作者: Tu Nguyen, Nedim Šrndić, Alexander Neth

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Tu Nguyen, Nedim Šrndić, Alexander Neth

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字世界中,网络安全专家扮演着信息守护者的角色,不断扫描入侵的迹象。为了有效地做到这一点,他们依赖于一个庞大的已知攻击方法库,这是一个被称为“战术、技术与过程”(TTPs)的标准目录。可以将这些理解为犯罪分子剧本中的特定招式:战术是目标,例如窃取数据或挟持系统;技术是实现该目标的手段,例如发送欺骗性电子邮件或隐藏文件;而过程则是该手段的具体执行步骤。安全分析师阅读其他专家撰写的数千份报告,这些报告描述了黑客是如何入侵系统的。他们的工作就是阅读这些叙述,并将所述的行为与目录中的正确条目进行匹配。这一过程被称为 TTP 映射,它至关重要,因为这让防御者能够识别模式、预测未来的攻击并加强防御。然而,这个目录规模巨大,包含数百种技术和数千种变体,而报告本身通常是用复杂的、非结构化的语言编写的,并未明确命名所使用的技术。

多年来,研究人员一直试图教计算机自动执行这种匹配任务。标准方法是将此视为一场多项选择测试,即计算机必须从海量的可能性列表中,为它阅读的每一句话或每一段话选出正确的技术。这种方法遇到了重大麻烦,因为选项列表非常长,而可用于训练的示例数量又非常少。这就像是要求一名学生背诵整本字典,然后要在从未见过相关故事的情况下,为一段故事挑选出正确的单词。计算机会被庞大的选项数量所压倒,并且难以学习它们之间的细微差别,特别是对于那些在训练数据中出现频率较低的罕见或异常攻击方法。

华为慕尼黑研发中心的一支研究团队提出了一种解决此问题的新方法。他们不再强迫计算机从一个巨大的选项列表中进行选择,而是将这项任务重新构想为一场匹配游戏。在这种新方法中,计算机并不尝试将每种技术都与文本进行排名。相反,它学习如何衡量一段文本的内容与特定技术的描述之间的对齐程度。系统会从一份威胁报告中提取一段文字,并将其直接与目录中某种技术的书面描述进行对比。如果含义相似,系统就会给出高分;如果含义不同,则给出低分。这使关注点从记忆庞大的列表转向了理解两段文本之间的关系。

为了在有限的数据下实现这一目标,研究人员开发了一种巧妙的训练方法。他们不会一次性向计算机展示所有的技术,否则会太慢且令人困惑。相反,他们会向计算机展示一段文本以及与之进行对比的几个随机技术。其中一些技术是正确的匹配,而另一些则是错误的。计算机通过学习将正确匹配的分数推高,并将错误匹配的分数降低。研究人员通过两个特定的调整优化了这一过程,以处理现实世界数据的杂乱性。首先,他们调整了训练,以确保计算机在关注错误选项的整体情况时,不会被其内部顺序所迷惑。其次,他们教会系统对训练数据中的错误具有一定的容忍度。由于人类专家有时会遗漏报告中某个技术的标注,系统学会了将某些“错误”答案视为潜在的正确答案,从而避免变得过于僵化。

该框架的结果通过使用真实的网络安全报告进行了测试。研究人员创建了一个新的专家标注段落数据集,以确保测试的公平性,该数据集比以往的数据集包含更多的样本标签。当他们运行实验时,这种基于匹配的方法始终优于那些试图将文本分类到固定类别的传统方法。即使在报告复杂或技术罕见的情况下,新系统在识别正确技术方面也表现出色。它比旧模型能更频繁地找到正确的匹配,而旧模型往往会在庞大的可能性面前迷失方向。

研究还表明,训练数据的规模不如匹配逻辑的质量重要。即使只有相对较少的标记示例,该系统也能很好地泛化到新的、未见的报告中。这表明,理解威胁描述与技术之间的语义联系,比单纯记忆大量的关联列表更为强大。研究人员发现,当系统能够查看整个段落而非仅仅是孤立的句子时,效果最好,因为这样可以捕捉到攻击的完整上下文。通过专注于文本与技术描述之间的直接关系,该系统避免了试图将一个复杂且微妙的问题强行塞入僵化分类框的陷阱。

最终,这项工作为自动化分析网络威胁提供了一条更高效的路径。它证明了,通过改变问题的框架——从大规模的选择任务转变为直接的比较任务——计算机即使在数据匮乏的情况下,也能学习识别复杂的攻击模式。这种方法不仅提高了分析速度,还提高了准确性,使得安全团队能够依靠自动化工具来识别攻击者正在使用的具体方法。随着网络威胁不断演变并变得更加复杂,拥有一个能够理解威胁报告中微妙联系的系统,将成为保障数字基础设施安全的必备工具。研究人员已向社区开放了他们的新数据集和方法,希望能推动这一关键领域的进一步发展。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →