Mitigating The Effect of Class Imbalance in Data with Hierarchical and Dependable Structure
本文提出了一种层次感知型 RoBERTa 框架,该框架利用可学习的父类嵌入来有效缓解 CWE 漏洞分类中的类别不平衡问题,并证明了引入层次结构的效果优于传统的过采样技术(后者往往会降低模型性能)。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名正在试图整理一大堆关于计算机安全漏洞线索的侦探。这些漏洞被组织在一个名为**通用弱点枚举(CWE)**的巨大家族树中。在树的最顶端是宽泛的类别,比如“基础”(Base,即大局观);随着你向下移动,分支变得越来越具体,最后延伸到微小的、罕见的叶片,如“复合型”(Compound)或“支柱型”(Pillar)。
问题在于?侦探的证据袋完全是不平衡的。对于那些庞大、常见的类别,有数百条线索;但对于那些罕见、特定的类别,却只有寥寥数条。这就像一个图书馆,有 500 本关于“水果”的书,但只有 5 本关于“火龙果”的书。如果你试图教一台计算机来分类,它会变得很懒,每次都直接猜“水果”,因为那是它见得最多的。
“伪造线索”实验(行不通的方法)
为了解决这个问题,许多专家尝试了一种叫做**过采样(oversampling)**的技巧。他们提取了那些稀有的线索,并试图发明新的、虚假的线索,让数量看起来相等。他们使用了两种流行的策略:SMOTE 和 ADASYN。
你可以把这想象成一位厨师试图让汤的味道闻起来更有稀有香料的气息。他不是去寻找更多真实的香料,而是将两粒现有的香料颗粒混合在一起,并寄希望于这种新的混合物尝起来是地道的。
该论文在不同类型的“侦探”(计算机模型)上测试了这一点:
- 老派侦探(随机森林 Random Forest 和 支持向量机 SVM): 这些模型就像是观察简单事实列表的侦探。当喂给它们这些虚假的混合香料时,它们得到了微小的提升。随机森林的准确率从 0.65 提升到了 0.69,而支持向量机(SVM)则稳定在 0.71–0.72 左右。这确实有帮助,但并不多。
- 高科技侦探(CNN 和 BiGRU): 这些是更聪明的深度学习模型,它们理解单词是如何流动的。当研究人员把这些虚假的混合香料喂给它们时,结果简直是一场灾难。在使用 SMOTE 时,CNN 的准确率从 0.71 暴跌至 0.55;使用 ADASYN 时则降至 0.51。BiGRU 也从 0.70 跌落至 0.53 和 0.44。
为什么? 论文认为,这些高科技模型就像是能分辨出真实香料与虚假混合物的厨师。当你把两个不同的计算机“单词”混合在一起制造出一个虚假的单词时,你破坏了家族树的规则。你可能会创造出一个声称是“基础”(Base)类别的“变体”(Variant),但这个虚假的混合物实际上并不尊重其父子关系。这就像试图通过混合“苹果”和“香蕉”来制造“火龙果”。结果并不是火龙果,而是一个让侦探感到困惑的混乱产物。
“家族树”方案(真正奏效的方法)
他们没有制造虚假线索,而是构建了一个新的侦探:层级感知 RoBERTa(Hierarchy-Aware RoBERTa)。
想象一下,这个侦探口袋里揣着一张特殊的家族树地图。他们不仅阅读线索,还会查看地图,心想:“等等,如果这个线索属于‘基础’类,那么答案必须与那个父级相关。”
该模型的工作原理如下:
- 它读取漏洞的文本描述(使用强大的工具 SecureBERT)。
- 它从家族树中获取一个“父级 ID”(比如知道这条线索属于“基础”分支)。
- 它将文本阅读内容与地图位置相结合,做出最终判断。
结果:
这个新侦探完全不需要任何虚假线索。它在没有任何数据增强的情况下,实现了 0.76 的加权 F1 分数。
- 与标准的 BERT 模型相比,后者的得分是 0.74。
- 最重要的是,看看稀有的“类别”(Class)这一项。标准的 BERT 模型在该稀有组别的 F1 分数仅为 0.49。而新的“层级感知”模型将其提升到了 0.60。
核心结论
该论文表明,当你拥有一个结构化的家族树数据时,试图通过混合现有部分来“伪造”更多数据(过采样)是一个坏主意。这对于简单的模型或许还行,但会破坏更先进的模型。
相反,最好的方法是从一开始就教会模型尊重家族树的结构。通过给模型一张包含父子关系的“地图”,它能比仅仅用合成噪声填充训练数据更好地处理那些稀有且棘手的案例。
然而,作者也谨慎地指出,即使是他们最好的侦探,在面对极其罕见的类别(如“复合型”和“支柱型”,分别只有 8 个和 5 个样本)时仍然感到吃力。对于这些极度稀少的组别,所有模型的 F1 分数始终保持为 0.00,这表明当几乎没有任何数据时,即使有家族树地图也无法破解谜团。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。