← 最新论文
📊 statistics

Challenges in the calibration of tree-based models for imbalanced classification

本文表明,对在欠采样不平衡数据上训练的树类模型进行解析校准会导致不可靠的患病率估计和意想不到的偏差,并据此主张使用基于学习的校准方法(如 beta 校准)。

原作者: Nathan Phelps, Daniel J. Lizotte, Douglas G. Woolford

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Nathan Phelps, Daniel J. Lizotte, Douglas G. Woolford

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观: “食谱”问题

想象你是一位正在学习如何做出完美浓汤的厨师。然而,你的厨房极度不平衡:你有 10,000 个土豆,但只有 10 个胡萝卜。如果你试图通过品尝一碗含有 10,000 个土豆和 10 个胡萝卜的汤来学习食谱,你永远无法学到胡萝卜的味道。你会认为这碗汤 99.9% 都是土豆。

为了解决这个问题,你决定进行欠采样(undersampling)。你扔掉了大部分土豆,现在碗里有 50 个土豆和 10 个胡萝卜。现在,你的训练数据是平衡的,你可以更好地学习食谱了。

症结所在: 当你最终为真实世界烹饪这道汤时(那里实际上有 10,000 个土豆),你的味觉仍然习惯于那个平衡的碗。你会认为汤里有 50% 的胡萝卜,但实际上它仍然是 99.9% 的土豆。你的预测是“有偏的”。

旧有的解决方法:“数学公式”

长期以来,数据科学家使用一个特定的数学公式(论文中的等式 1)来修复这个问题。其思路很简单:“我们知道我们扔掉了 90% 的土豆。让我们只需将我们的预测值乘以一个数字,在数学上把它们‘加回来’。”

这篇论文的作者说:“别再那样做了。”

他们发现,这个数学公式对于基于树的模型(如随机森林)效果并不好。这个公式非但没有修复汤的味道,反而让味道变得极其难以捉测。

发现的两个主要问题

1. “旋钮”问题(预测因子的数量)

想象你的随机森林是一个由 500 名侦探组成的团队,他们正在试图破解一个谜团。

  • 规则: 在每一步中,侦探们只能观察一定数量的线索(预测因子/特征)来决定下一步该怎么走。
  • 实验: 作者转动了一个“线索旋钮”。有时他们让侦探只看 2 个线索;有时他们让侦探看 15 个线索。

发生了什么?
当他们使用旧的数学公式来修复偏差时,最终的答案会根据侦探被允许观察的线索数量而发生剧烈变化。

  • 如果他们看 2 个线索,模型预测会有 100 场火灾。
  • 如果他们看 15 个线索,模型预测会有 140 场火灾。

类比: 这就像是请一群人来猜一个西瓜的重量。如果你告诉他们只能看颜色,他们猜 10 磅。如果你告诉他们要看颜色、茎部、敲击的声音以及纹理,他们猜 15 磅。
在一个完美的世界里,数学公式 应该修正这些猜测,使它们都落在同一个真实的重量上。但事实并非如此,该公式反而让这些猜测离得越来越远。侦探使用的线索越多,最终的估计值就跳动得越大。

2. “意外的偏差”(采样率)

通常,我们认为如果你拥有太少的“少数类”项目(比如那 10 个胡萝卜),模型会忽略它们并给出过低的预测。

  • 旧观点: “决策树会忽略少数类。”
  • 论文的发现: 在他们的实验中,决策树的表现恰恰相反!它们高估了少数类。

类比: 想象你正在尝试猜一个装有 1,000 个弹珠的罐子里有多少个红弹珠(990 个蓝弹珠,10 个红弹珠)。你取了一个小样本。

  • 预期: 你可能会猜“也许只有 1 或 2 个红弹珠”(低估)。
  • 树模型的表现: 树模型观察了样本后说:“哇,红弹珠到处都是!我敢打赌有 50 个红弹珠!”

作者发现,随着他们改变采样率(扔掉了多少土豆),模型的这种高估现象变得越来越严重。数学公式试图修复这一点,但由于树模型本身已经在高估,公式只会让最终结果变得更加混乱。

现实世界案例:野火

作者使用关于加拿大艾伯塔省野火的真实数据测试了这一点。

  • 野火是罕见的(就像那些胡萝卜)。
  • 他们使用了“数学公式”来修复模型。
  • 结果: 取决于他们如何设置“线索旋钮”(预测因子的数量)或如何进行采样,模型对未来火灾数量的预测可能会产生高达 40% 的偏差。
  • 为什么这很重要: 如果政府机构使用这些模型来决定在哪里派遣消防车,他们可能会仅仅因为调整了计算机代码中的一个设置,就导致把太多的消防车派往一个地区,而另一个地区却空无一人。

结论

论文得出结论,使用“数学公式”(解析校准)是处理这项特定任务的一个失效工具。它会导致以下情况:

  1. 改变一个设置(如线索的数量)会改变答案,尽管答案本不该改变。
  2. 模型有时会认为少数类的出现频率比实际情况更高,而公式无法修复这一点。

解决方案: 作者建议不要使用僵化的数学公式,而是使用“学习型”方法(如 Beta 校准)。这可以理解为聘请一位试吃员,他会真正品尝最终的汤并学习如何调整调料,而不是试图用计算器来计算调整量。

一句话总结

在基于树的模型中使用简单的数学公式来修复“不平衡”数据是行不通的;它会让预测变得极不稳定,有时还会导致模型高估稀有事件,因此我们需要更智能的、基于学习的方法来修复偏差。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →