← 最新论文
🤖 machine learning

Self-Supervised Learning of Graph Representations for Network Intrusion Detection

该论文提出了 GraphIDS,这是一个通过使用掩码自编码器重构正常网络流量的局部图嵌入,从而通过在多种 NetFlow 基准测试上产生高重构误差来有效识别入侵的自监督框架,实现了表示学习与异常检测的统一。

原作者: Lorenzo Guerra, Thomas Chapuis, Guillaume Duc, Pavlo Mozharovskyi, Van-Tam Nguyen

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Lorenzo Guerra, Thomas Chapuis, Guillaume Duc, Pavlo Mozharovskyi, Van-Tam Nguyen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每天,数十亿台设备在互联网上交换数据,构建起一个庞大且无形的通信网络。这些流量中的大部分是无害的,像一条平稳流动的河流,由常规的请求和响应组成。然而,在这股流中,隐藏着试图入侵系统、窃取信息或破坏服务的恶意行为者。捕捉这些入侵者对安全团队来说是一个持续的挑战,因为攻击者非常聪明;他们频繁变换战术,并且经常模仿正常行为以躲避检测。传统的安全工具依赖于精确了解攻击的具体形态,将新流量与已知威胁的库进行对比。这种方法对于熟悉的危险有效,但当出现一种全新的、未见过的攻击类型时就会失效。为了解决这个问题,研究人员开始转向另一种策略:教计算机深刻理解什么是“正常”,从而使任何偏差都能立即显现出来,就像一名保安熟悉建筑物的常规节奏,能瞬间察觉到有人以不寻填的行为移动一样。

在最近的一项研究中,来自法国的一个研究小组提出了一种名为 GraphIDS 的新系统来应对这一问题。该系统并不试图记忆特定的攻击模式,而是学习健康网络流量的自然结构。他们不将网络视为一系列孤立消息的列表,而是将其视为一张活生生的地图,其中计算机是地点,在它们之间流动的数据则是道路。通过研究这张地图,系统可以观察设备通常如何相互通信。研究人员发现,通过结合两种强大的人工智能类型,他们可以构建一个无需任何攻击示例进行训练即可学习这种正常行为的模型。该系统的工作原理是尝试重建它所见过的正常流量模式。当它遇到奇怪或可疑的流量时,它会难以重建该流量,而这种“挣扎”便预示着潜在的威胁。

这种新方法的核心在于研究人员组织数据的方式。他们将原始的网络流量记录(称为 NetFlow 数据)转化为一个图(graph)。在这个图中,网络上的每台计算机都是一个点,两台计算机之间的每条连接都是一条线。每条线都携带了关于对话的细节,例如发送了多少数据包或传输了哪种类型的数据。该系统的第一部分——图神经网络(graph neural network),充当了一个局部观察者的角色。它观察特定的连接,并检查相关计算机的直接邻居。它会提出类似这样的问题:“这台计算机现在还在和谁说话?”以及“这次对话对于这个群体来说是否典型?”这使得系统能够理解单个数据流的局部上下文,捕捉定义常规行为的小规模模式。

一旦系统理解了这些局部细节,它就会将信息传递给第二部分——一个基于 Transformer 的引擎,后者负责观察大局。这个组件将许多连接分组在一起,并分析它们在整个网络中是如何相互关联的。它学习系统的全局习惯,例如哪些计算机组倾向于频繁通信,或者流量在不同时间通常如何流动。为了训练这个系统,研究人员使用了一种称为掩码自编码器(masked autoencoder)的技术。想象一下,向系统展示一张完整的正常流量图像,然后隐藏其中的一小部分。系统的任务是根据剩余的图像来猜测被隐藏的部分应该是什么样子。因为它仅在安全、正常的流量上进行训练,所以它变得非常擅长预测一个健康的连接应当呈现何种状态。它如此精通游戏的规则,以至于可以为它遇到的任何正常流“填补空白”。

当系统遇到新事物时,这种方法的真正威力就会显现出来。如果出现恶意流,它会打破系统所学习的规则。当系统尝试根据其训练内容来预测这个奇怪的流应该是什么样子时,它会失败。预测结果很差,且系统预期发生的情况与实际发生的情况之间的差异很大。研究人员将这种差异称为“重建误差”(reconstruction error)。在测试中,他们发现这种误差是入侵的一个可靠信号。属于攻击的流量始终产生高误差,而正常流量则产生低误差。这使得系统能够在训练阶段从未见过任何攻击示例的情况下,就能标记出潜在的威胁。

该团队在两个包含来自不同环境的数百万个网络流的大型真实数据集上测试了他们的系统。其中一个数据集来自较小的网络,而另一个则代表了一个更大、更复杂的架构。在两种情况下,该系统的表现都非常出色。在较小的数据集上,它几乎识别出了所有的攻击,同时保持了极低的误报率。在更大、更具挑战性的数据集上,它的表现仍然显著优于现有方法,在某些衡量指标上达到了接近完美的水平。研究人员将他们的工作与其他同样尝试在没有标注攻击数据的情况下检测异常的先进系统进行了对比。他们的系统始终排名更高,证明了将图神经网络的局部视角与 Transformer 的全局视角相结合,比单独使用其中任何一种方法都更有效。

最重要的发现之一是,系统不需要被告知什么是攻击,就能学会如何识别攻击。通过完全专注于重建正常行为,该模型自然地学会了拒绝任何不符合规则的事物。这是一个至关重要的优势,因为在现实世界中,攻击者总是在发明新的花招,而安全团队往往没有足够的标注数据来教计算机每一种可能的威胁变体。GraphIDS 系统通过学习“安全的形状”绕过了这个问题。如果流量看起来是安全的,系统可以轻松重建它;如果流量看起来是危险的,系统就会踉跄,而这种“踉跄”就是警报。

研究人员还探索了如果移除系统的某些部分会发生什么。当他们去掉图组件并仅向系统输入原始数据时,其性能下降了,尤其是在规模更大、更复杂的网络中。这表明,理解设备之间的连接对于发现微妙的攻击至关重要。同样,当他们用一个更简单的引擎替换掉先进的 Transformer 引擎时,系统虽然仍能正常工作,但一致性较差且准确度略有下降。这些测试证实,局部上下文和全局模式对于系统发挥其全部潜力都是必要的。这项研究表明,检测入侵的最佳方式是建立一个能够深度理解网络结构和习惯的模型,而不是仅仅死记硬背一份坏行为清单。

尽管结果令人鼓舞,但研究人员也承认没有任何系统是完美的。他们的模型假设网络在一段时间内表现得相对稳定。如果网络发生剧烈变化,例如在进行重大升级或用户行为突然转变时,系统可能会产生困惑并引发误报。他们建议,未来的工作可以包括教导系统随着网络的发展进行持续适应,而不是要求重新进行完整的训练。他们还指出,在仅监控单个设备的情况下,由于无法看到更广泛的网络上下文,系统能利用的信息会较少。尽管存在这些局限性,这项研究仍展示了保护数字基础设施方面的一次重大进步。通过将局部连接的研究与全局模式统一起来,GraphIDS 系统提供了一种鲁棒的、自监督的方式来维护网络安全,通过学习正常的节奏,从而听出入侵者的不和谐音符。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →