Disentangling Mechanism, Budget, and Coverage in Data Augmentation for Imbalanced Malware Family Classification
本文解构了深度生成模型在不平衡恶意软件分类中生成机制、增强预算和覆盖范围的影响,发现虽然大多数因素带来的性能增益微乎其微,但增加增强预算能为 RBF-SVM 分类器提供微小但可复现的改进,从而凸显了在评估数据增强策略时实验设计的重要性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字世界中,安全团队正面临着一场持续且不对称的恶意软件之战。他们必须根据行为将成千上万个计算机程序进行分类,就像生物学家根据叶片形状对植物进行分类一样。问题在于,他们所依赖的数据存在严重的倾斜现象。一些常见的恶意软件家族在记录中出现了数千次,而许多稀有的、新兴的家族仅出现过几次。当一个计算机程序试图从这种不平衡的数据中学习时,它会变得非常擅长识别常见威胁,却无法识别那些稀有的威胁,而这些稀有威胁往往因为其新颖性和不可预测性而最具危险性。为了解决这个问题,研究人员尝试了一种称为“数据增强”的技术。这涉及创建稀有家族的虚假示例,以教导计算机程序如何识别它们。一些研究人员使用简单的办法,即复制并轻微修改现有的示例;而另一些人则使用复杂的深度学习系统,试图从零开始想象出一个新的示例应该是什么样子。主流观点一直认为,更复杂、更有想象力的系统能产生更好的虚假数据,从而带来更好的安全工具。
圣何塞州立大学的一组研究人员决定测试这个说法是否真的成立。他们旨在观察这些华丽、复杂的系统是否真的更优越,或者这些工具的成功仅仅是因为它们创建了多少个虚假示例以及它们选择了哪些家族进行重点关注。为此,他们构建了一个受控实验,使用了一个包含近 1,20 \ 种代表二十个不同家族的恶意程序数据集。他们选取了二十个不同的家族,范围从仅有五个已知样本到一百五十个样本不等,并创建了一个计算机程序必须学习识别它们的训练环境。研究人员比较了三种不同类型的学习系统:随机森林(通过提出一系列是或否的问题来进行决策)、神经网络(通过连接层进行学习)以及支持向量机(根据数据点之间的距离在不同组别之间绘制边界)。他们使用两种不同的方式来描述恶意软件测试了这些系统:一种是统计特定计算机指令出现的频率,另一种是将这些指令转化为数学坐标以捕捉其含义。
研究人员制定了一套严格的规则以确保公平比较。他们匹配了为每个家族创建的虚假示例数量,并确保每种方法针对的都是相同的家族。这使他们能够分离出三个特定因素:用于创建虚假数据的具体方法、生成的虚假示例总数,以及接受这些虚假示例的不同家族数量。他们将一种在现有示例之间进行插值的简单方法,与一种从噪声中生成数据的未经调优的复杂生成系统进行了对比。当他们观察结果时,发现复杂的生成式系统并未一致地优于简单的方法。事实上,对于研究中最有效的学习系统而言,使用复杂生成器与使用简单生成器之间的差异微乎其微,几乎难以察觉。该研究并未检测到来自生成器复杂性的显著影响,同时也承认,虽然未发现效应,但较小的效应仍有可能存在,且并未被分析排除。相反,他们发现最重要的因素仅仅是添加了多少虚假示例。当他们增加特定家族的合成样本数量时,基于距离的学习系统的性能有了明显的提升。
研究人员还发现,增加虚假数据的益处在不同类型的学习系统之间分布并不均匀。唯一显示出随着虚假样本增加而产生清晰、可重复改进的系统,是那种依赖于测量数据点之间距离的系统。其他系统(包括随机森林)本身表现得已经足够出色,以至于添加虚假数据几乎没有产生任何影响。在某些情况下,随机森林在没有任何增强的情况下就达到了最高的准确率。这表明,对于某些类型的学习工具而言,生成复杂虚假数据的努力可能是没有必要的。研究还调查了向更多家族(而非仅仅是那些最难处理的家族)添加虚假数据是否有帮助。他们发现,扩大范围以涵盖更多家族确实带来了小幅提升,但其效果大约只有单纯增加已有目标家族样本数量的一半。
这些发现挑战了“更先进的人工智能在执行此类任务时总是更好”的假设。研究人员得出结论,在不控制创建示例数量的情况下,对比不同的生成模型是一种误导性的做法。当示例数量和针对的家族数量保持不变时,选择哪种生成器远不如提供的数据量重要。最可靠的改进来自于单纯地增加稀有家族的数据点,而这一因素可以通过更简单的方法来实现。对于安全分析师而言,这意味着在投资复杂的系统来生成新的恶意软件示例之前,他们应首先考虑其目前的学习工具是否仅仅是因为缺乏数据而导致训练不足。如果他们使用的是依赖于测量示例间距离的系统,那么增加数据才是关键。如果他们使用的是已经足够健壮的系统(如随机森林),那么生成复杂合成数据的额外努力可能并不值得。该研究并非声称复杂的生成器毫无用处,但它表明,其优势并不像此前认为的那样是自动且普遍存在的,而且数据的数量往往比创建数据的方法更为重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。