← 最新论文
💻 computer science

Applying JEPA-Style Predictive Learning to JA4-Derived Network Fingerprints

本文介绍了 JA4-JEPA,这是一种基于 Transformer 的模型,它成功地将 JEPA 式的预测学习应用于从 JA4 衍生的指纹中生成高质量的网络嵌入,尽管在不同训练源之间存在视图重叠不完整的问题,仍实现了极强的协议族分类准确率。

原作者: Javier Izquierdo, Aygul Zagidullina

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Javier Izquierdo, Aygul Zagidullina

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在拥挤的火车站里识别一名神秘的旅行者。通常情况下,安检人员只是将一张身份证(“指纹”)与一份庞大的已知面孔名单进行比对。如果卡片匹配,那就太好了;如果不匹配,他们就束手无策。这就是目前大多数计算机网络识别流量的方式:它们查看一个简短的代码(比如 JA4 指纹),然后说:“哦,那是一个 Web 浏览器,”或者“那是一个服务器。”这种方式很快,但非常僵化。它并没有真正“理解”这位旅行者,它只是在匹配一个名牌。

现在,想象一位新型侦探,他不再仅仅是检查一份名单。相反,这位侦探会观察旅行者携带的几件不同的线索——一顶帽子、一只鞋子、一张车票和一个背包。即使旅行者缺少了一顶帽子,或者侦探看不见那个背包,侦探也会尝试猜测那些缺失的线索应该是什么样子。如果猜测结果与现实相符,侦探就能学到关于旅行者风格的深层知识。

这正是卢塞恩大学的研究人员开发出的名为 JA4-JEPA 的新系统所做的事情。

“缺失碎片”谜题

研究团队从两个不同的来源收集了大量的网络“身份证”(约 397,000 个样本)。这些卡片包含四个部分:

  1. JA4: 基础客户端 ID(就像护照)。
  2. JA4H: 客户端如何与网站交谈(就像对话)。
  3. JA4S: 服务器如何响应(就像回复)。
  4. JA4X: 数字证书的细节(就像签证)。

棘手之处在于:在他们的样本堆中,没有任何一张身份证包含全部四个部分。 有些缺少对话过程,有些缺少回复内容。这就像是通过一些只显示半个身体的照片来学习一个人的长相。

研究人员构建了一个智能 AI(Transformer 模型)来玩一场“填空游戏”。他们向 AI 展示身份证的某些部分,并要求它预测隐藏的部分。与其试图重绘整个图像(这既困难又缓慢),不如让 AI 在一个隐藏的精神空间中预测缺失部分的本质或“氛围”。这种方法被称为 JEPA(联合嵌入预测架构),它通常用于图像和视频,而非网络代码。

结果:一种全新的超能力

训练完成后,研究人员冻结了 AI 的大脑并对其进行了测试。他们问道:“你能告诉我这段流量是 Web 浏览器(TLS)、域名系统(DNS)还是安全外壳协议(SSH)吗?”

结果令人惊喜地强大:

  • AI 的预测结果与真实的隐藏部分在余弦相似度上达到了 0.9899(这几乎是完美的,就像双胞胎一样)。
  • 当用于对流量进行分类时,一种简单的邻居检查方法在 39,416 个新的、未见过的样本上达到了 92.20% 的正确率。

这表明,即使在数据不完整的情况下,该 AI 也学习到了丰富且有用的表示形式。它不再仅仅是匹配一个名牌,它理解了流量的结构

“异常”测试:抓捕冒充者

为了看看这种新方法是否真的比旧方法更好,团队在来自企业网关的 210 万 对真实世界流量数据集上运行了第二次测试。他们创建了两类“虚假”异常(诡计),以观察哪个系统能识破它们:

  1. 洗牌(The Shuffle): 将一个真实的 ID 与一段随机的、无关的对话混合在一起。
  2. 硬正例(The Hard-Positive): 将一个真实的 ID 与一段它从未进行过的对话混合在一起,尽管这两个部分都是常见的。

他们将这种新 AI 与其他五种方法进行了对比:频率计数、最近邻查找、自动编码器和聚类。

研究结果非常明确:

  • JA4-JEPA 模型是唯一一个在两种诡计上都表现强劲的模型。对于“洗牌”测试,它的 AUC 为 0.922(该分值中 1.0 代表完美);对于“硬正例”测试,其 AUC 为 0.925
  • 其他方法在至少一种测试中失败了。例如,简单的频率计数器对这些新的组合完全视而不见,而最近邻查找法随着数据的增长变得既缓慢又混乱。
  • 速度: 该 AI 在标准 CPU 上每秒可以对 8,000 对 进行评分,且其速度不会随着数据库的增大而减慢。相比之下,最近邻方法的速度从每秒 3,400 对 降到了仅 250 对

论文没有说明的内容

了解这个“魔术技巧”目前无法做到的事情也很重要。

  • 它还不是恶意软件的“水晶球”: 论文明确指出,虽然它可以区分 Web 浏览器、DNS 服务器或 SSH,但它目前还无法告诉你正在运行的是哪个具体的应用程序(例如“Chrome”对比“Firefox”)或者流量是否具有恶意。它们使用的标签过于宽泛。
  • 它在“观察”一切方面并不完美: 由于训练数据缺失部分信息(没有样本拥有全部四个视图),AI 可能会过度依赖它始终能看到的那个部分(JA4)来猜测其余部分。作者认为,虽然结果很有前景,但我们无法 100% 确定 AI 是否学习到了各视图之间深层的联系,因为在训练过程中它从未见过完整的全貌。
  • “校准”仍处于开发阶段: 该 AI 非常擅长进行排序(知道哪个更可疑),但设定一个具体的“警报线”(阈值)仍然很困难。在 5% 的误报预算下,它仅抓住了 53% 的棘手“硬正例”异常。它的排序能力很强,但精确的报警设置仍需进一步完善。

总结

论文表明,教 AI 去“猜测缺失的部分”的网络指纹是一种理解流量的强大新方法。它创造了一个轻量级、快速且智能的系统,在识别异常组合方面优于现有方法。然而,这还不是一个已解决的问题:研究人员持谨慎乐观的态度:该方法在对流量类型进行分类和识别异常方面是有效的,但要使其成为能够捕捉特定病毒或应用的真实世界安全工具,我们需要更详细的标签以及在所有拼图碎片都实际存在的场景下的更好数据。

简而言之,AI 学习“猜缺失碎片”的游戏玩得如此之好,以至于即使在图片残缺的情况下,它也开始理解整体画面。但我们仍需教会它如何从人群中识别出那些特定的坏人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →