← 最新论文
💻 computer science

Malformer: A Multi-Modal Malware Detector Using Transformers

该论文介绍了 Malformer,这是一种基于四模态 Transformer 的检测器,它融合了 Windows 可执行文件的文本、图像、图结构和音频表示,实现了 98.3% 的准确率,显著优于传统的单模态和双模态恶意软件检测系统。

原作者: Samuel Howard, Kshitiz Aryal, Mahmoud Abdelsalam, Maanak Gupta, Andrew Wheeler, Pradip Kunwar

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Samuel Howard, Kshitiz Aryal, Mahmoud Abdelsalam, Maanak Gupta, Andrew Wheeler, Pradip Kunwar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字世界中,安全团队正面临着一场持续且不断变化的恶意软件之战。几十年来,主要的防御手段是寻找已知的指纹:即用于识别病毒的特定代码模式或独特的数字签名。这种方法对旧威胁非常有效,但当攻击者创造出新的、未见的程序,或者通过轻微修改现有程序来掩盖行踪时,这种方法就会失效。为了保持领先地位,研究人员转向了机器学习,教计算机去识别恶意软件潜在的、细微的底层结构,而非仅仅匹配已知模式。早期的尝试曾试图教计算机阅读原始代码,或者将文件视为一张简单的图像,但每种方法都存在盲点。单一观察文件的方式可能会错过关键线索,就像试图仅通过影子来识别一个人,或者仅通过声音来辨别一个人一样。

来自田纳西理工大学、内布拉斯加大学奥马哈分校和北卡罗来纳州立大学的研究人员开发了一种名为 Malformer 的新系统,旨在克服这些局限性。该系统并非依赖于单一的文件视角,而是同时从四个完全不同的维度观察同一个文件。他们将文件处理为文本文档、图像、连接图谱以及声波。通过结合这四个视角,该系统能够构建出关于文件意图的更丰富的理解。研究人员在超过 20 万个计算机文件的庞大集合上测试了这种方法,发现通过这四个透镜同时观察问题,使系统识别威胁的准确度显著高于仅使用一两个视角的系统。

Malformer 的核心理念在于,代表文件的不同方式会揭示不同类型的信息。当计算机文件被转换为文本时,它展示了程序向处理器发出的具体指令。当同一个文件被转化为图像时,它揭示了数据排列中的模式,类似于指纹显示脊和谷。当转换为图(graph)时,它绘制了程序不同部分之间如何进行通信的地图,展示了控制流。最后,当被视为音频信号时,文件中的字节序列会产生携带节奏模式的声波。研究人员发现,仅依赖其中一种视角往往会留下漏洞。例如,如果攻击者对文本代码进行了混淆以隐藏其内容,图像或声音视角可能仍能显示出恶意结构。通过融合这四个视角,该系统创建了一个安全网,使得一个视角可以补偿另一个视角的弱点。

为了构建这个系统,研究人员使用了被称为“Transformer”的高级工具,这是一种能够理解数据中复杂关系的强大计算机模型。他们改进了这些模型以处理这四种不同类型的数据。对于文本和连接图,他们使用了旨在理解语言和序列的模型。对于图像,他们使用了一个通常用于分析照片的模型,但将其修改为能够识别文件字节模式的形式。对于声音,他们使用了经过人类语音训练的模型,用以聆听文件数据的节奏。挑战不仅在于创建这四个独立的视角,还在于教系统如何权衡它们之间的关系。研究人员开发了一种方法,可以在训练过程中自动调整系统对每个视角的关注程度。如果某个视角学习得比其他视角快,系统会暂时减少其影响力,以确保较慢的视角能够赶上,从而防止整个系统产生偏向于某种特定信息类型的偏差。

这种方法的实验结果令人瞩目。在对 201,549 个文件进行测试时,Malformer 系统正确识别恶意软件的概率达到了 98.3%。这一表现明显优于仅观察一种数据类型或甚至结合了两种数据类型的系统。研究人员发现,这四个视角的结合提供了一种单一视角无法实现的细节水平。更重要的是,该系统证明了其韧性。在现实场景中,文件的某些部分可能会损坏或无法读取,导致其中一个视角失效。研究人员测试了如果移除文本视角或连接图视角会发生什么,结果发现系统仍然表现出色,仅准确度略有下降。这表明该系统并不依赖于单一的故障点,而是依赖于四个视角所构成的集体力量。

这项研究还强调了每个视角的独特价值。虽然图像视角是最一致且最可靠的,但连接图视角在可用时提供了最强的个体信号。文本视角(代表汇编代码)在连接图无法正确提取时特别有用。声音视角——这在这一领域是一种较少采用的方法——也被证明是有效的,它捕捉到了其他视角遗漏的模式。通过将这些多样化的方法结合在一起,研究人员创建了一个不仅更准确,而且对攻击者隐藏行为的手段更具鲁棒性的检测器。这项工作表明,恶意软件检测的未来不在于寻找一种完美的分析文件的方法,而在于整合多种互补的观察同一威胁的方式。随着攻击者不断演变其手段,拥有一个能够同时从四个不同角度观察问题的系统,为我们赖以生存的数字基础设施提供了一种强大的、通用的防御手段。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →