A Comparison of Malware Image Transformations Using Grad-CAM and Hybrid Learning Models
本文通过使用 Grad-CAM 进行可解释性分析以及使用混合 MobileNetV2-Random Forest 模型进行分类,评估了八种恶意软件图像转换技术,结果表明,尽管该方法实现了 0.777 的新基准准确率,但分类准确率与生成的解释的忠实度之间不存在直接相关性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图抓住一名伪装大师的侦探。在数字世界中,这种“伪装”就是恶意软件——旨在潜入你的计算机并制造麻烦的恶意程序。长期以来,侦探们通过逐行阅读代码来寻找线索,但这些数字罪犯变得越来越擅长掩盖行踪。于是,研究人员想出了一个聪明的窍门:与其阅读代码,不如将软件变成一张图片。把它想象成拍摄一张嫌疑人鞋底的指纹,并将其转化为地形图。不同的恶意软件家族会在这些地图中留下不同的“纹理”,就像不同的鞋子会留下不同的鞋底花纹一样。
为了破解这个谜题,侦探们使用了一种特殊的 AI,叫做卷积神经网络(CNN)。你可以把这种 AI 想象成一个超级扫描仪,它观察这些恶意软件图片并学习识别模式,就像你在人群中识别出一位朋友的面孔,而不需要知道他的名字一样。但问题的关键在于,这些 AI 扫描仪通常是“黑盒”。它们能给你一个答案,但却无法轻易解释为什么它们认为这张图片是反派。为了解决这个问题,科学家们使用了 Grad-CAM 工具。如果说 AI 是一个正在观察犯罪现场的侦探,那么 Grad-CAM 就是一支荧光笔,它标出了侦探在做出决定时盯着图片的哪些具体位置。这篇论文提出了一个重大问题:我们将代码转化为图片的方式,是否会改变 AI 破解案件的效果?更重要的是,那个“荧光笔”展示的是真相,还是仅仅是一幅漂亮的画?
研究人员在这项研究中决定测试八种不同的将恶意软件代码转化为图像的方法。他们将这些图像视为一个艺术画廊,其中每种风格(如“灰度图”、“熵希尔伯特图”或“二元组极坐标图”)都试图突出代码的不同特征。他们在这些八种不同的“艺术风格”上训练了他们的 AI 扫描仪,以观察哪一种能更好地帮助 AI 识别恶意软件。但他们并未止步于此。他们还使用了 Grad-CAM 荧光笔来观察 AI 究竟在看什么。他们想知道:如果 AI 得了高分,它看的是正确的线索吗?还是它只是根据一个幸运的模式在瞎猜?
这里的情况变得非常有趣。团队发现了一个令人惊讶的转折:产生高分的“最佳”图片风格,并不总是能提供最诚实的解释。想象你有两张藏宝岛的地图。一张地图是由一位天才绘制的,他每次都能找到宝藏,但他的绘图方式对其他人来说毫无意义。另一张地图是由一名学生绘制的,虽然他找到宝藏的频率较低,但他的地图非常清晰、逻辑严密,任何人都可以遵循。研究人员发现,对于恶意软件而言,产生最忠实、最可靠的“荧光笔”解释(具体来说是“二元组极坐标图”风格)的图像风格,实际上导致了 AI 较低的准确率得分。相反,获得最高准确率的风格(“熵希尔伯特图”)在展示 AI 到底在看哪里方面虽然非常出色,但并非完美。
论文还测试了一种新策略:如果我们不仅向 AI 展示原始图片,还向它展示“被高亮显示”的版本,会怎样?这就像是给学生展示教材的同时,也展示一份带有重点句子的版本。他们发现,对于某些风格,这种“高亮”版本实际上有助于 AI 更好地学习。通过将原始图片与高亮版本结合起来,并将所有这些信息喂给一个聪明的决策者(随机森林模型),他们成功提升了成功率。他们从之前约 75% 的准确率记录提升到了 77.7%。
论文中驳回的最重要观点之一是:“更好的准确率总是意味着更好的解释”这一想法。他们证明了你可以拥有一个非常擅长猜对答案的模型,但它观察的是图像中错误的部分来进行判断。他们还表明,虽然某些图像风格非常稳定(即使图片稍微模糊或有噪声,AI 看到的依然相同),但另一些则非常敏感。“二元组极坐标图”风格在反映 AI 所见内容方面最为诚实,但它也最容易受到图像微小变化的干扰。
最后,研究人员并没有找到单一的“灵丹妙药”式图像风格。相反,他们展示了“混搭”才是最好的方法。通过提取所有八种不同图像风格以及所有不同高亮方式下的 AI “大脑”,并将它们组合成一个巨大的超级特征,他们创造了一个比任何单一方法都更难被欺骗的系统。他们不仅解开了谜题,还向我们展示了:有时,为了得到最好的答案,你必须同时从八个不同的角度来看待问题。这项研究表明,在捕捉数字坏人的世界里,准确性和可信度并不总是齐头并进的,而最聪明的侦探是那些懂得如何组合工具的人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。