Related Families, Not Label Errors: A Case Study of a Failure Mode in Open-World Malware Evaluation on BODMAS
本文表明,在 BODMAS 基准测试上表现较差的开放世界恶意软件检测性能,并非由标签错误或检测器缺陷所致,而是由于训练集中存在高度相关的家族,使得被留出的“新颖”样本对于无监督新颖性评分方法而言实际上是熟悉的。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字世界中,安全研究人员构建旨在充当“哨兵”的程序,不断扫描威胁计算机的恶意软件。这些程序被训练用于识别已知的威胁,但真正的挑战在于“开放世界”,即每天都会出现全新的恶意软件类型。为了测试这些哨兵是否真正准备好应对未知,研究人员使用了一种特定的方法:他们将一整组已知的恶意软件从训练程序中隐藏起来,然后问道:“你的系统能否将这组新出现的样本识别为它从未见过的东西?”如果系统将隐藏组标记为陌生事物,则视为通过测试。这一过程假设隐藏组是真正独特的,并且与训练数据中没有近亲。如果隐藏组实际上是系统已知组的一个“表亲”,那么测试就会失效,这并非因为系统能力弱,而是因为提出的问题本身存在缺陷。
最近,一个研究小组调查了针对一种名为 BODMAS 的最受尊敬的恶意软件检测测试中出现的令人困惑的失败案例。他们发现,当他们从训练数据中移除一个名为 berbew 的特定恶意软件家族时,检测系统出现了惨败。该系统并没有将隐藏样本标记为新威胁,而是自信地将其归类为安全的已知软件。结果非常糟糕,甚至比随机猜测的表现还要差。乍看之下,这似乎是检测技术的一次灾难性失败。然而,研究人员发现,问题的根源不在于软件的智能,而在于测试本身的结构。隐藏的 berbew 家族有一个非常近的亲属,名为 qukart,它仍然留在训练数据中。由于这两个组在数字指纹上非常相似,系统正确地识别出隐藏样本属于它已经知道的一个家族,尽管它并不知道这个特定家族的名字。测试是在惩罚系统对两者之间关系的准确识别。
为了证明这一点,研究人员进行了一项受控实验。他们同时从训练数据中移除了 berbew 和 qukart 两个家族,确保没有留下任何近亲。当他们再次运行测试时,系统对 berbew 样本的检测性能从失败的分数飙升至接近完美的水平。这种戏剧性的转变证实了最初的失败是由训练集中存在相关的家族引起的,而不是由检测算法的缺陷引起的。研究人员仔细排除了其他常见的解释。他们审计了整个数据集,检查了数千对恶意软件家族,以查看是否存在因名称不同但实际为重复项的情况,从而导致混淆。他们发现这些疑似对之间并不存在重复项。他们还检查了杀毒软件厂商的命名习惯,这些厂商通常将相关的恶意软件归入同一个谱系名称下。他们发现这些名称并不能预测问题;在一个记录在案的案例中,虽然有三个家族被视为同一谱系的一部分,但实际上只有其中两个足够接近以至于会引起混淆,第三个则是截然不同的,这表明仅依赖名称就会合并错误的组并忽略真实的问题。
研究进一步揭示,这种混淆特定于系统衡量“新颖性”的方式。研究人员测试了几种不同的数学方法来识别未知事物。他们发现,任何将样本与所有已知软件的广泛全局摘要进行比较的方法,在存在近亲时都会失败。这些方法会将隐藏样本视为正常的,因为它靠近已知的亲属。然而,另一种仅将样本与其最近邻进行比较的方法表现得更好。它虽然没有完全得到正确答案,但并未彻底扭转结果,这表明在存在近亲时,观察局部细节而非全局平均值是一种更稳妥的策略。研究人员还注意到,一个允许在训练中使用家族名称的有监督系统可以有效地分离这两个组,这证明了标签是正确的且两个家族是截然不同的,只是非常相似。
这项工作的核心教训是,我们测试安全软件的方式需要改变。仅仅报告一个关于系统检测新威胁能力的单一平均分,会掩盖这些关键的失败。研究人员认为,在宣布一项测试成功之前,我们必须首先测量隐藏组与用于训练的组之间的亲缘关系有多近。如果一个隐藏组在训练集中有一个近亲,那么测试测量的就不是寻找真正未知事物的能力,而是区分非常相似的已知事物的能力。解决方案并不是将这些相关的家族从测试中移除,因为它们代表了安全团队必须处理的现实威胁。相反,研究人员应该分别报告针对有近亲的家族和没有近亲的家族的结果。这种透明度确保了系统不会因为正确识别了一个已知的谱系而受到不公平的惩罚,并提供了关于技术真实水平的更清晰图景。通过记录这种特定的失败模式以及理解其过程所采取的步骤,研究人员希望防止他人重复同样的错误,并鼓励对我们的数字哨兵能否真正洞察未知的能力进行更诚实的评估。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。