← 最新论文
🤖 machine learning

Contrastive Learning and Correlation Clustering for Sequences of Network Telescope Data

本文提出了一种基于 Transformer 的对比学习方法,用于在没有语义标注的情况下对网络流记录序列进行嵌入和聚类,并证明了其在识别互联网扫描器之间的关系以及泛化至未见来源方面的有效性。

原作者: Jannik Presberger, Alexander Männel, Maynard Koch, Thomas C. Schmidt, Matthias Wählisch, Bjoern Andres

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jannik Presberger, Alexander Männel, Maynard Koch, Thomas C. Schmidt, Matthias Wählisch, Bjoern Andres

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一座巨大的、混乱的城市,数以百万计的人(计算机)不断地向彼此发送信件(数据包)。大多数信件都是普通的邮件。但有时,会出现一些“扫描器”——就像那些激进的推销员或安全测试人员——他们敲响城市里的每一扇门,看看哪些门是没锁的。

问题在于,这些推销员太多了,而且各不相同。有些人敲门很快,有些人很慢,有些人使用不同的工具。试图手动搞清楚哪个推销员属于哪家公司是不可能的,因为他们没有名牌(标签),而且这座城市太大了,无法时刻监视每一个人。

这篇论文提出了一种巧妙的方法来解决这个问题,即使用一个“智能镜子”和一个“分组游戏”。

智能镜子(Transformer 模型)

研究人员构建了一个特殊的计算机程序(Transformer 模型),它充当了一个智能镜子的角色。它不看信件的内容,而是观察特定推销员敲门的“模式”。

  • 它是如何学习的: 通常,要教会计算机识别模式,你需要一个老师来告诉你:“这是推销员 A,那是推啦员 B。”但在这里,并没有老师。
  • 这个窍门: 该程序使用了一种叫做**对比学习(Contrastive Learning)**的技术。想象你有一堆照片。你告诉计算机:“拿两张同一个人的照片(即使他们戴着不同的帽子或站在不同的位置),并在你的脑海中让它们看起来非常相似。拿不同人的照片,并让它们看起来截然不同。”
  • 结果: 计算机学会了根据每个推销员的敲门习惯来创建“指纹”,而无需被告知他们是谁。它学会了“在 5 秒钟内敲 100 扇门”是一种特定的风格,而“在 1 分钟内敲 10 扇门”是另一种风格。

分组游戏(相关聚类)

一旦计算机创建了这些指纹,研究人员就会玩一个叫做**相关聚类(Correlation Clustering)**的游戏。

  • 目标: 他们想要根据指纹的相似程度,将所有的推销员进行分类。
  • 挑战: 他们不知道应该有多少个组,也不知道每个组的大小。
  • 解决方案: 算法会观察指纹之间的“距离”。如果两个推销员的指纹非常相似,算法就会说:“把他们放在同一个房间里。”如果他们不同,算法就会把他们放在不同的房间。它会自动完成这一切,在不需要预设组数的情况下找到自然的簇。

他们的发现

研究人员在一个庞大的互联网流量数据集上测试了这一点(就像观察整个城市一小时一样)。结果如下:

  1. 识别同一个人: 当他们向计算机展示来自同一个推销员(在训练期间未曾见过)的两组不同的敲门模式时,计算机正确地将它们识别为“相似”。它知道他们是同一个人,尽管这些模式并不完全一致。
  2. 识别不同的人: 当他们展示来自不同推销员的模式时,计算机正确地识别出它们是“不同”的。
  3. 按“公司”分组: 最令人兴奋的部分是,当他们根据这些指纹对推销员进行分组时,这些组别与研究人员已知的真实世界扫描器公司(如 Censys 或 Shodan)相匹配。尽管计算机从未被告知这些公司的名字,但它自然地将“Censys”的推销员归为一类,并将“Shodan”的推销员归为另一类。

难点(“灰色地带”)

论文指出,分组并不完美。有时,来自不同公司的推销员看起来如此相似(也许是因为他们使用了相同的工具或敲了相同的门),以至于计算机产生了困惑并将他们混淆了。这表明,虽然计算机学到了很多东西,但“指纹”并不是一张完美的身份证;它捕捉的是攻击的“风格”,而这种风格在不同群体之间有时会发生重叠。

核心结论

这篇论文表明,你只需要通过观察行为,就能教会计算机理解互联网扫描器的“个性”,而无需人类先对数据进行标注。通过使用智能镜子来学习相似性,并使用分组游戏来进行分类,他们可以自动将混乱的互联网流量组织成有意义的组别,从而帮助安全专家发现以前无法看到的模式。

简而言之: 他们教会了计算机如何通过倾听敲门的节奏,来识别“谁在敲门”以及“谁属于哪个帮派”,而无需被告知这些帮派的名字。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →