A Multi-Feature Fusion-Based Obfuscation-Resistant Malware Detection Scheme
本文提出了 TriFuseDroid,一种鲁棒的 Android 恶意软件检测方案,该方案分析了代码混淆对静态特征的影响,并采用多特征融合网络将具有韧性的静态视图转换为图像表示,从而在无需混淆训练样本的情况下,实现了针对多种混淆技术的高准确率和高泛化能力。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在安卓操作系统这一庞大的数字生态系统中,一场无声的冲突正在开发者与那些旨在窃取数据或破坏设备的恶意软件设计者之间上演。为了捕捉这些数字入侵者,安全研究人员长期以来一直依赖静态分析,这是一种无需实际运行应用程序即可检查其代码的方法。他们寻找特定的指纹,例如应用请求访问手机摄像头或联系人的权限列表、其遵循的指令序列,以及它所调用的特定系统函数。然而,恶意软件的创造者已变得擅长掩盖行踪。他们使用一种称为“代码混淆”的技术,通过扰乱应用程序的内部结构并重命名其组件,使代码在人类或计算机程序看来都像是一团乱麻。这种持续的捉迷藏游戏使得许多传统的检测方法失效,因为它们所依赖的特征签名已被这些伪装改变或抹除。
重庆大学的一个研究小组提出了一种打破这一僵局的新方法,提供了一个无需预先识别伪装即可看穿伪装的系统。他们的工作名为 TriFuseDroid,其起点并非一种新的运行代码的方式,而是对不同类型的混淆究竟如何影响研究人员所使用的特定线索进行了深入且系统的调查。他们选取了大量的应用程序,并对其应用了八种不同的扰乱方法,范围从简单的变量重命名到复杂的程序逻辑重排序。通过将原始的、干净的代码与这些被扰乱的版本进行对比,他们精确测量了每种方法在多大程度上改变了文件大小、文本相似度以及数据结构。他们发现,虽然某些特征(如应用所需的权限列表)几乎完全不受扰乱影响,但其他特征(如函数之间如何相互调用的详细映射图)则被完全破坏或改动到了无法辨认的地步。
凭借这份漏洞图谱,研究人员设计了一个仅关注代码中那些在扰乱后依然存留部分的检测系统。他们选择了应用程序的三个核心视图:主可执行文件、应用使用的系统函数列表以及它请求的权限。他们并没有尝试去读取这些文件的原始文本(因为这些文本在经过混淆后会发生剧烈变化),而是将它们转化为视觉表示。他们将可执行文件转化为一个显示一段数据如何过渡到下一段数据的数字网格,从而创建一个即使在单个字符发生变化时也能保留代码整体形状的独特图像。同样,他们将系统函数和权限列表转化为语义图像,这些图像捕捉的是应用的行为含义,而非仅仅是函数的具体名称。这一过程使他们能够创建一个即使在底层文本被严重扭曲时仍能保持稳定的视觉指纹。
该系统的核心是一个神经网络,这是一种受人类大脑启发、旨在同时观察这三种不同图像的计算机程序。该网络并不将它们视为独立的证据,而是将它们融合在一起,学习稳定的权限列表、具有韧性的函数调用以及可执行文件的结构图像是如何协同工作以识别威胁的。这种多特征融合技术使得系统能够补偿任何单一视图的弱点;如果其中一个图像由于混淆而带有轻微噪声,另外两个视图则能提供做出正确判断所需的清晰度。研究人员利用各种经过扰乱处理的应用程序对该系统进行了测试,其中包括那些经历了最激进且复杂形式的代码隐藏处理的应用。
结果表明,这种新方法显著优于现有技术。当面对被高度扰乱的应用时,旧的检测系统往往会失效,其准确率下降到无法可靠区分安全软件与危险软件的水平。相比之下,新系统保持了极高的准确度,即使在应用经过伪装的情况下,也能正确识别绝大多数恶意应用。至关重要的一点是,该系统在无需针对这些特定伪装样本进行训练的情况下实现了这一目标。它学会了识别那些在扰乱过程中依然存在的恶意行为底层模式,而不是死记硬背攻击者使用的特定技巧。这表明该方法为应对未来各种形式的代码混淆提供了稳健的防御,提供了一种更可靠的方式来维护数字生态系统的安全,而无需在每种新的隐藏技术出现时都对检测软件进行持续更新。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。