← 最新论文
🤖 machine learning

ThreatVisionAI: A Hybrid CNN-ViT Framework for Image-Based Malware Classification

ThreatVisionAI 是一个结合了原始图像 CNN、小波 CNN 和视觉 Transformer 的混合框架,通过有效捕捉互补的空间、频域和全局关系特征,实现了最先进的恶意软件家族分类准确率。

原作者: Allyson Taylor, Prashanth BusiReddyGari

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Allyson Taylor, Prashanth BusiReddyGari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图整理一大堆伪造的钞票。有些看起来几乎与真钞一模一样,而有些则被涂上了肉眼难以察觉的隐形墨水或奇特的纹理。传统的保安(旧的杀毒软件)只是检查一份已知的黑名单序列号。如果出现了一张从未见过的假钞,他们就会放行。

名为 “ThreatVisionAI” 的论文提出了一种全新的、超级聪明的分类团队来处理这项工作。该团队不再仅仅盯着序列号看,而是将每段恶意软件(坏的计算机代码)转化为一张灰度图片,并使用三位不同的“专家”同时对这张图片进行分析。

以下是这三位专家是如何工作的,使用了简单的类比:

团队中的三位专家

  1. “像素侦探”(原始图像 CNN):

    • 它做什么: 这位专家逐个像素地观察图片,就像它原本的样子。这就像一名侦探在观察钞票的形状和颜色,看看边缘是否参差不齐,或者是否存在重复的图案。
    • 优势: 它擅长捕捉局部细节和熟悉的形状。
    • 劣势: 如果两张假钞从远处看几乎完全一样,它有时会漏掉细微的区别。
  2. “纹理低语者”(基于小波变换的 CNN):

    • 它做什么: 这是该论文的特别创新。想象一下,你拿着那张钞票,通过一个特殊的过滤器将其分解为它的频率。它将“平滑”的部分与“粗糙”的部分分开,并观察水平、垂直和对角线的“纹理颗粒”。
    • 优势: 它能发现“像素侦探”会错过的微小且具有方向性的纹理。这就像是通过触摸纸张的纹理来分辨两张看起来完全一样的假钞。论文发现,这位专家对于区分那些在人类眼中看起来几乎相同的恶意软件家族至关重要。
    • 劣势: (注:原文此处未直接列出劣势,仅描述了其功能与优势)
  3. “大局观察者”(Vision Transformer 或 ViT):

    • 它做什么: 当另外两位专家在观察特定位置时,这位专家会退后一步,同时观察整幅图像。它会将左上角与右下角之间的点连接起来,理解不同部分之间是如何在全局范围内相互关联的。
    • 优势: 它理解整幅图像的“故事”,而不只是单个句子。

他们如何协同工作

该团队并不让一位专家做最终决定,而是使用了一个**“加权软投票”**系统。把它想象成一个陪审团:

  • “像素侦探” 拥有 50% 的投票权(因为它最可靠)。
  • “纹理低语者” 拥有 40% 的投票权(它非常擅长捕捉细微差别)。
  • “大局观察者” 拥有 10% 的投票权(它增加了额外的上下文信息)。

他们结合各自的意见来做出最终决定。

结果:他们表现如何?

团队在一个著名的恶意软件图像数据集 Malimg 上测试了这个系统,该数据集包含约 9,500 张来自 25 种不同类型恶意软件的图片。

  • 得分: 团队实现了 98.01% 的准确率。这意味着在 100 张新的恶意软件图片中,他们能正确识别出 98 次恶意软件的家族。
  • 胜利之处: “纹理低语者”(小波变换)是明星选手。它帮助团队区分了两个非常相似的恶意软件家族(称为 Swizzor.gen!ESwizzor.gen!I),而其他专家在区分它们时非常吃力。如果没有这种基于频率的视角,团队会更容易把它们搞混。

他们无法解决的一个问题

论文承认存在一个顽固的问题。有两种类型的恶意软件——Autorun.KYuner.A——它们的图像形式看起来极其相似,以至于即使是最优秀的专家也无法分辨。

  • AI 尽了最大努力,但它总是把原本是 Autorun.K 的样本误判为 Yuner.A
  • 研究人员使用了一种叫做 Grad-CAM 的工具(它可以高亮显示 AI 正在观察的部分)并发现,AI 在处理两者时观察的位置完全相同。
  • 结论: 这不是 AI 的错误,而是数据的局限性。这些图片本身就太过于一致了。

缺陷(局限性)

  • 对抗性攻击: 论文测试了如果有人尝试通过添加微小的、肉眼不可见的噪声(就像魔术师的障眼法)来欺骗 AI 会发生什么。系统的准确率显著下降,这表明如果攻击者了解该模型的运作方式,它是可以被愚弄的。
  • 陈旧数据: 测试数据来自 2011 年。虽然该方法在这个旧数据集上表现良好,但作者指出,他们尚未在现代的大规模数据集上进行测试。

总结

ThreatVisionAI 是一个混合系统,它不仅观察恶意软件图像,还倾听它们的“纹理”并理解它们的“全局结构”。通过结合这三种不同的观察方式,它们以极高的准确率对恶意软件进行分类,证明了观察图像的“频率”与观察图像本身同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →