← 最新论文
📊 statistics

An Insight on Evaluation Metrics Under the Imbalanced Case of Anomaly Detection

本文通过引入指标图谱(metric landscapes)来提供在不同数据集之间解释和比较检测结果的实用指导,分析了常见的异常检测指标(AUROC、AUPR、F1-score 和 MCC)在不同类别不平衡水平下的表现。

原作者: Romain Hermary, Nesryne Mejri, Djamila Aouada

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Romain Hermary, Nesryne Mejri, Djamila Aouada

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

标题:关于异常检测中类别不平衡情形下评估指标的见解

问题陈述
异常检测本质上具有严重的类别不平衡特征,即异常样本相对于正常数据而言非常稀少。这种不平衡使得标准评估指标的解释变得复杂。虽然 AUROC、AUPR、F1 分数和马修斯相关系数(MCC)被广泛使用,但它们的数值含义会随异常比例的变化而不同。单一的标量分数往往会丢弃有关模型行为的信息,且在不同的不平衡程度下,相同的分数可能对应着截然不同的分类器行为。此外,在仅在正常数据上进行训练的无监督设置中,评估是在高度偏斜的测试分布下进行的,这使得性能评估变得十分微妙。尽管存在加权版本的标准度量,但在异常检测中通常会避免使用它们,以防止评估与操作层面的类别分布脱节。因此,目前对于如何跨越不同的不平衡机制来解释这些标准指标尚未达成共识。

方法论
作者提出了一种系统性的分析方法,旨在研究四种常见异常检测指标(AUROC、AUPR、F1 和 MCC)在广泛的类别不平衡比例下的表现。其核心方法论贡献是引入了度量景观(metric landscapes),这是一个将度量分数映射到真阳性率(TPR/召回率)和真阴性率(TNR/特异性)空间上的可视化框架。

本研究利用了:

  1. 数据集: 一组代表时间序列异常检测(TSAD)、单类分类(OCC)和图像异常检测(IAD)的多样化基准数据集。其中包括 UCR、WaDi、PUMP、SWaT、PSM、CIFAR-10、ViSA 和 MVTec,覆盖了从 0.19% 到 90% 的异常比例。
  2. 零假设分析(Null Analysis): 通过在不同不平衡比例(从 99:1 到 1:99)下对随机预测进行 100 次运行,计算均值、标准差和平均正偏差,以此建立基准。
  3. 景观演变: 通过对比平衡(50:50)和不平衡(例如 5:95)设置下的度量景观差异,观察度量偏好是如何发生偏移的。
  4. 因子分析: 通过计算不同不平衡组(低、中、高)之间的 Tucker 一致性系数和 Pearson 相关系数,研究指标间的潜在关系。

关键结果

  • 指标稳定性与基准:
    • 在随机预测下,AUROC 和 MCC 在所有不平衡比例下都保持在 0.5 左右,尽管 AUROC 表现出更高的变异性(平均正偏差高达 ~0.25)。
    • F1 和 MCC 在随机行为下的方差较低,使其不易受到伪高分的误导。
    • AUPR 的基准随异常比例线性变化,使得偏离随机性能的程度易于量化,尽管在特定区间内会出现明显的向上偏差。
  • 景观行为:
    • AUROC 对类别不平衡具有不变性;无论比例如何,其景观结构保持不变。
    • AUPR 和 F1 对不平衡高度敏感。随着负类占据主导地位,AUPR 景观显著下降(在许多区域下降 0.2–0.4),反映出负类性能影响力的减弱。F1 需要越来越高的 TNR 才能在异常比例降低时达到与之前相同的分数。
    • MCC 呈现出复杂的模式:极端的 TNR 值保持稳定,但分布在中间值附近发生压缩,使得在严重不平衡下的平均分数解释变得不再直观。
  • 最小检测需求:
    • 对于 AUROC,无需检测到任何正样本即可达到 0.5 的分数。
    • 对于 AUPR,在平衡数据集中实现高分需要即使在正样本检测极少的情况下也能完全正确分类负样本。
    • 对于 F1,提高分数总是需要更多被正确分类的正样本,但随着异常比例的降低,对正确分类负样本的要求也会随之增长。
    • 对于 MCC,在高度不平衡(如 UCR)的数据集上,即使不检测任何正样本且仅正确分类约 10% 的负样本,也可能获得 ~0.4 的分数,尽管这仍低于随机基准。
  • 指标关系:
    • 中度不平衡机制下,所有指标都表现出相似的载荷分布和高相关性,表明它们捕捉到了相关的结构。
    • 低度(高度不平衡)机制下,指标变得更具互补性。AUROC 和 MCC 保持紧密相关,而 F1 和 AUROC 的一致性最弱。
    • 高度不平衡(正类占主导)机制下,指标进一步去相关。值得注意的是,AUROC 和 MCC 保持了完全的相似性(Tucker 一致性为 0.997),而 AUPR 和 AUROC 则表现出一致性降低。

意义与贡献
本文认为,只要在解释时明确考虑指标值、预测质量与类别不平衡之间的依赖关系,现有的指标仍然是有用的。其主要贡献在于引入了度量景观作为一个直观的框架,用于可视化不同指标如何强调灵敏度(sensitivity)与特异性(specificity)之间的权衡,以及这些偏好如何随不平衡程度的增加而转移。

这项工作为在具有不同不平衡比例的数据集上解释和比较异常检测结果提供了实践指导。它并非旨在为所有场景寻找一个单一的“最佳”指标,而是提供了一个参考点,用以理解度量行为在现实条件下的表现。作者指出,相同的分数可能对应着不同的分类器行为,而其分析有助于澄清这些区别。未来的工作方向被确定为将此分析扩展到其他领域,如工业监控、物联网、网络安全和自动驾驶。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →