← 最新论文
💻 computer science

Correcting Class Imbalance in Prior-Data Fitted Networks for Tabular Classification

本文通过调整经典缓解技术,解决了先验数据拟合网络(PFN)在表格分类中面临的类别不平衡挑战,发现阈值法利用PFN的校准能力实现了更优的性能,而欠采样则以降低推理成本提供了可比的结果。

原作者: Samuel McDowell, Nathan Stromberg, Lalitha Sankar

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Samuel McDowell, Nathan Stromberg, Lalitha Sankar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位超级聪明、经过预训练的侦探,名叫PFN。这位侦探在训练期间阅读了数百万个虚构故事,并且仅凭少量线索就能极其出色地解决新案件(这种技术称为“上下文学习”)。他们无需为每一项新任务重新训练大脑;只需查看你提供的证据,便能做出推断。

然而,这位侦探有一个重大盲点:类别不平衡

问题:“多数票”偏差

想象你让这位侦探在一堆 1,000 枚硬币中找出一种稀有且特定的硬币。

  • 950 枚是普通便士(多数类)。
  • 50 枚是稀有金币(少数类)。

由于侦探在训练过程中见过太多便士,他们变得懒惰。每当看到一枚新硬币时,他们总是猜“便士”。

  • 结果:他们 95% 的时候都是对的(因为大多数硬币确实是便士)。
  • 陷阱:他们漏掉了每一枚金币。如果你正在寻找那枚稀有金币(就像寻找罕见疾病或网络攻击一样),这位侦探就毫无用处。

这篇论文提出了一个问题:我们如何在不对这位侦探进行新考试训练(即重新训练,而他们无法做到)的情况下,修复这个问题?

解决方案:三种调整侦探的方法

研究人员尝试了三种不同的“技巧”,让侦探关注那些稀有硬币。

1. “降低门槛”技巧(阈值调整)

通常情况下,侦探会说:“我有 51% 的把握这是金币,所以我称之为金币。”但由于他们偏向于便士,他们很少对金币达到 51% 的置信度。

研究人员意识到,侦探对其置信度水平非常诚实(他们是“校准良好”的)。他们只需要一点推动。

  • 修复方法:与其等待 51% 的置信度,我们告诉侦探:“只要你哪怕有 10% 的把握是金币,就称之为金币!”
  • 类比:这就像降低考试的及格线。如果学生通常需要 90 分才能及格,但考试很难,你可能会将及格线降至 60 分,以免所有人都不及格。
  • 结果:这效果惊人。侦探开始捕捉到稀有金币,而不会丢失太多便士。这是最简单且最有效的修复方法。

2. “隐藏便士”技巧(下采样)

与其改变规则,不如改变证据。我们将 1,000 枚硬币的一堆中扔掉 900 枚便士,只留下 50 枚便士和 50 枚金币。

  • 修复方法:现在这堆硬币是平衡的。侦探不能只是猜“便士”就能在大多数时候猜对;他们必须真正查看线索。
  • 额外好处:因为需要查看的硬币更少,侦探解决案件的速度更快(所需的计算能力更少)。
  • 结果:这也非常有效,几乎与“降低门槛”技巧一样好。

3. “伪造硬币”技巧(过采样与合成上采样)

这是其他方法试图提供帮助的地方。

  • 过采样:我们将那 50 枚金币复印,直到拥有 500 枚金币。
  • 合成上采样:我们使用机器人发明新的假金币,使其看起来像真币,并将它们加入堆中。
  • 结果:这些方法失败了
    • 复印硬币(过采样)让侦探感到困惑,因为这堆硬币看起来很奇怪且“尖锐”。
    • 假硬币(合成)不足以教会侦探任何新东西。事实上,它们让侦探在识别真正的稀有硬币方面变得更差。

主要启示

这篇论文发现,你不需要复杂的 AI 魔法来解决这个问题。

  1. 不要生成虚假数据。这只会让事情变得混乱。
  2. 要调整决策规则。简单地告诉模型“更愿意猜测稀有事物”,比几乎任何其他方法都有效。
  3. 要移除常见数据。如果你有太多常见内容,扔掉一些。这会让模型更快、更公平。

简而言之:这位超级聪明的侦探只是对稀有物品过于谨慎。通过简单地告诉他们稍微不那么谨慎(降低阈值),或者给他们一个更小、更公平的证据堆(下采样),他们就变得非常擅长发现那些他们之前遗漏的稀有事物。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →