← 最新论文
🤖 machine learning

Self-Supervised Representations for Binary Program Clustering: From Empirical Study to Retrieval-Augmented Learning

本文首次对用于二进制程序聚类的自监督与表格表示学习进行了系统性研究,确定了 VIME 是一种新的最先进方法,并提出了 VIME-R,这是一种显著提升了恶意软件聚类性能的检索增强变体。

原作者: Martin Mocko, Daniela Chudá

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Martin Mocko, Daniela Chudá

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一座巨大且繁忙的城市,每天都有数以百万计的新“数字居民”抵达。大多数是友好的邻居,但也有一些是试图偷窃、破坏或制造混乱的狡猾入侵者。这些入侵者被称为恶意软件(malware)。仅在 2024 年,就有超过 8000 万个这样的新成员出现。为了维护城市的安全,保安人员(网络安全专家)需要将这些数百万个文件进行分类。如果他们能识别出某个新文件属于某个已知“坏人”的同一个“家族”,他们就能瞬间拦截威胁。这个分类过程被称为聚类(clustering)

通常情况下,如果你有一份列出名字(标签)并告知身份的名单,分类会很容易。但在现实世界中,保安们经常必须面对一大堆没有任何名字的神秘文件。这正是**自监督学习(Self-Supervised Learning, SSL)表格表示学习(Tabular Representation Learning, TRL)**发挥作用的地方。你可以把 SSL 想象成一名学生,通过观察同一物体的两张略有不同的照片,并在没有老师告诉答案的情况下,猜出它们是同一个东西。而 TRL 则是专门教计算机理解“电子表格数据”(即由数字组成的行与列),而不是图片或文本的艺术。研究人员一直提出的核心问题是:我们能否仅仅通过观察这些数字,就教会计算机将这些神秘的恶意软件文件归类到完美的家族中,而无需任何人类教师的帮助?


神秘文件的谜团

在这项研究中,研究员 Martin Mocko 和 Daniela Chudá 决定扮演侦探的角色,处理一大堆数字文件。他们想看看现代 AI 技术(通常用于识别照片中的猫或理解句子)是否可以被重新利用,用于将恶意软件文件分组。他们使用了两个巨大的、公开的 Windows 文件数据集,分别叫做 EmberBodmas。这些数据集就像巨大的图书馆,包含了数十万个文件,每个文件都由一组长长的数字(特征)来描述,这些数字就像是它们的指纹。

研究人员将他们的调查分为两个阶段,就像一部两部曲的推理小说。

第一阶段:“如果……会怎样”测试
首先,他们想知道绝对可能的最高分是多少。想象一下,如果老师给了 AI 一份标准答案。他们采用了专门为图像设计的著名 AI 模型(如 BYOLSimSiamBarlow TwinsVICReg),并强迫它们通过比较那些它们已知属于同一个家族的文件来进行学习。这是一项“监督式”测试,旨在看看上限能达到多高。

结果喜忧参半。BYOLSimSiam 表现得像是超级英雄。在获得答案钥匙后,它们的表现几乎与完全监督的模型(即知道每一个家族名称的模型)一样出色,在通用类别上的“同质性”(Homogeneity,衡量分组纯度的指标)接近 99%,在特定家族上的得分超过 84%。然而,Barlow TwinsVICReg 则表现糟糕,甚至不如最简单的基准方法。事实证明,并非所有的“聪明”AI 模型在从图片转向电子表格时都同样聪明。

第二阶段:真正的挑战
接下来,研究人员拿走了答案钥匙。这是现实世界的情况:AI 必须在不知道任何家族名称的情况下对文件进行分类。他们将第一阶段中最优秀的模型与专门为电子表格数据设计的较新方法(如 VIMESCARFSwitchTab)进行了对比测试。

在这里,那些旧的基于图像的模型(BYOL 和 SimSiam)在被迫使用针对电子表格设计的“破坏(corruption)”技巧时显得力不从心。它们无法击败简单的基准方法。但是 VIME(数值填补与掩码估计)脱颖而出。它的工作原理是随机隐藏文件数据的某些部分,并尝试猜测缺失的部分,从而在此过程中学习模式。VIME 证明了自己是新的冠军,它击败了强大的传统基准方法(如 PCA 和自动编码器),并创下了新的技术领先记录(state-of-the-art)。

转折点:VIME-R
研究人员并没有就此止步。他们注意到 VIME 在猜测缺失数据时,是看向整个库中的随机文件。但如果它只观察那些与正在研究的文件非常相似的文件呢?他们发明了 VIME-R(检索增强型)。与其从整个人群中进行猜测,VIME-R 会询问:“谁是与这个文件最相似的 100 个邻居?”并利用它们的数据来填补空白。

这个简单的改变成为了游戏规则的改变者。VIME-R 不仅击败了其他无监督方法;在 Ember 数据集上,它甚至超过了在特定测试中表现最好的监督模型 SimSiam 所建立的“监督天花板”。虽然一个完全监督的 MLP 分类器在 Bodmas 数据集上得分更高,但在 Ember 上,VIME-R 实现了 77.48% 的家族同质性,超过了 SimSiam 的 76.53%。这意味着,通过使用一种聪明的“邻里”策略,这种无监督 AI 学习到的恶意软件家族分组能力,竟然比那个在特定语境下被明确告知了家族名称的监督模型还要好!

这对未来意味着什么

该论文表明,虽然一些流行的 AI 模型(如 Barlow Twins 和 VICReg)可能不是处理恶意软件电子表格的正确工具,但其他模型(如 BYOL 和 SimSiam)具有巨大的潜力,前提是我们能找到为它们创造正确的“文件对”的方法。

最重要的是,这项研究证明了**检索增强学习(retrieval-augmented learning)**是一个强大的新方向。通过教 AI 向其最近的邻居学习,而不是向整个世界学习,我们可以在不需要昂贵的人类标签的情况下,获得极其准确的结果。研究人员发现,与之前最好的方法相比,VIME-R 将聚类质量提升了 2.7% 到 5.8%

虽然这项研究局限于静态特征(即观察文件的蓝图而非观察其运行过程)以及特定的数据集,但其结果释放了一个强烈的信号。它们表明,只要运用正确的技巧,计算机就可以自主学习并组织混乱的恶意软件世界,从而潜在地帮助保安人员比以往更快地发现新威胁。这些方法的代码将被公开,邀请他人基于这一发现进行进一步的研究。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →