When Single-Dataset Conclusions Fail: A 45-Task Study of Threshold Tuning and Resampling for Imbalanced Classification
本研究表明,在不平衡分类任务中依赖单一数据集的评估具有误导性,因为一项涵盖 45 个任务的全面分析显示,阈值调优和 SMOTE 等重采样技术在不同不平衡比例下均能显著提升性能,这与在流行但缺乏代表性的信用卡欺诈数据集上观察到的无效结果截然不同。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在机器学习的世界里,计算机经常被要求做出二元选择:这封邮件是垃圾邮件还是不是,这笔交易是欺诈性的还是合法的,这张医学影像显示的是疾病还是健康状态。当一种结果比另一种结果常见得多时,这些任务会变得非常困难。如果一家银行每天处理一百万笔交易,而其中只有几百笔是欺诈交易,那么计算机看到的是一座由正常活动构成的“大山”,以及一个微小到几乎不可见的欺诈“高峰”。这被称为类别不平衡(class imbalance)。为了帮助计算机识别这些稀有事件,研究人员开发了标准工具。他们可能会人为地创造更多稀有事件的样本以平衡训练数据,或者可能会调整计算机内部的决策线。在默认情况下,计算机通常只有在确定度超过百分之五十时才会判定一个事件为正向。在不平衡的世界里,那条百分之五十的界限可能太高了,导致计算机完全错过那些稀有事件。因此,标准的做法是降低这条线,让计算机更愿意发出警报。
多年来,科学界一直依赖于一个著名的信用卡交易数据集来测试这些工具。它是该领域使用最广泛的基准,包含数十万笔真实交易,其中欺诈比例极低。当研究人员在这一特定数据集上测试其方法时,他们经常得出结论:标准工具是不必要的。他们发现,一个简单且经过良好校准的计算机模型可以完美地检测欺诈,而尝试调整决策线或平衡数据实际上会让情况变得更糟。这一发现成为了一个广泛接受的经验法则,暗示对于表现良好的模型,整个处理不平衡的机制都是多余的。
一项新的研究挑战了这一规则的安全性。来自昆士兰科技大学的研究人员提出了一个简单但深刻的问题:从一个特定数据集得出的结论是否适用于世界上的其他部分?他们首先通过一种严格的、无信息泄漏(leakage-free)的协议对那个著名的信用卡欺诈数据集进行了严谨的重新测试,确保测试结果中的信息不会意外影响训练过程。他们的结果证实了旧有的说法。在这个特定的数据集上,一种名为随机森林(Random Forest)的标准模型在其默认设置下表现最好,任何试图调整决策阈值或在训练集中添加合成数据的尝试都没有带来收益。事实上,在这一数据集上,这些调整反而使模型表现略微下降。
然而,研究人员并未止步于此。他们采用了完全相同的测试协议,并将其应用于由45个不同的二元分类任务组成的更广泛的集合中。这些任务范围广泛,从识别手写数字到诊断乳腺癌,既包括现实世界的数据,也包括精心构建的合成场景。这些新集合中的不平衡比例差异巨大,从1比1.5的轻微差异,到1比178的严重差异不等。当他们在这一多样化的套件中运行模型时,情况发生了逆转。
在信用卡数据集上奏效的结论,原来只是一个异常现象,仅针对那一个数据集和那一个模型。在45个任务中,那个在欺诈数据上不需要任何帮助的相同随机森林模型,实际上从决策阈值的调整中获益最多。那些在信用卡数据集上产生负面影响的调整,在更广泛的套件中却变得大有裨益。同样,一种被称为SMOTE的技术(即人工生成稀有类别的样本),在信用卡数据集上被发现是有害的,但在大多数其他任务中却显著提升了性能。研究人员发现,调整决策阈值的收益并不是一条随着数据不平衡程度增加而不断改善的直线。相反,这种收益遵循一个倒U型曲线:当不平衡程度较轻时,收益微乎其微;在中间范围的不平衡程度下达到顶峰;而在不平衡变得极端时,收益又会再次下降。
这一发现解释了为什么信用卡欺诈数据集(其不平衡比例高达1比577)是一个研究此类问题的糟糕场所。它处于调整收益最低且最难可靠测量的区域。研究还测试了一个常见的直觉:即研究人员可以通过观察模型的校准效果有多差,来决定是否根据校准情况调整阈值。他们发现这一直觉是错误的。模型的校准误差与它从调整中获得的帮助程度之间没有可靠的联系。一个模型可能校准得很差却从调整中获益甚微,也可能校准得很好却能从调整中获得大量收益。
这项研究对任何构建这些系统的人来说,其意义都是明确的。认为单一数据集可以为如何处理稀有事件提供通用规则的想法是不安全的。一种在某个数据集上表现完美的方法,可能会在另一个数据集上失效甚至适得其反。研究人员建议,从业者应该针对每一个新任务,都在验证集上常规测试不同的决策阈值,而不是假设默认设置就足够了,或者假设某种特定的调整总是必要的。他们还建议不要依赖校准诊断来做决定,因为这些指标无法预测结果。研究结论指出,虽然内部有效性(确保单个实验没有错误)很重要,但外部有效性(确保研究结果在不同数据间成立)同样至关重要。一个在单一数据集上方法论完美的实验,仍可能导致错误的普遍结论;而了解什么才是有效的唯一途径,就是通过广泛多样的情况进行测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。