← 最新论文
🤖 machine learning

Rethinking Loss Reweighting for Imbalance Learning as an Inverse Problem: A Neural Collapse Point of View

本文提出了一种面向长尾分类的新型逆视图损失重加权策略,该策略受神经坍缩启发,通过动态推断类别权重以实现理想的各类别损失均等目标,从而减轻损失不平衡并超越现有基线方法。

原作者: Jinping Wang, Zixin Tong, Zhiwu Xie, Zhiqiang Gao

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinping Wang, Zixin Tong, Zhiwu Xie, Zhiqiang Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位老师,正在为一次期末考试给全班学生打分。然而,这个班级有一个奇怪的问题:90% 的学生是“头部学生”,他们反复学习了相同的 10 个章节;而剩下的 10% 是“尾部学生”,他们只学习了 1 或 2 个章节。

在标准课堂(平衡数据集)中,老师会平等对待每个人。但在这个长尾课堂中,如果老师仅根据总分来评分,“头部学生”将主导讨论。老师会自然地关注那 90% 的学生,因为他们出现得更频繁,而“尾部学生”则会被忽视,尽管他们对班级的整体成功同样重要。

在人工智能领域,这被称为长尾学习。AI 模型在识别常见事物(如“狗”或“汽车”)方面表现出色,但在识别罕见事物(如“树懒”或“特定种类的甲虫”)方面却表现糟糕。

旧方法:猜测权重

为了解决这个问题,研究人员尝试了损失重加权。将“损失”想象成 AI 犯错时获得的分数。

  • 旧策略:研究人员试图猜测应该给“尾部学生”的分数“提升”多少。他们可能会说:“好吧,既然树懒学生很罕见,让我们将他们的错误乘以 10,这样老师就会更多地关注他们。”
  • 问题:这些方法大多是猜测(启发式方法)。它们并不真正知道完美的最终分数分布应该是什么样子。它们只是不断尝试不同的乘数,直到找到某种有效的方法,而没有明确的目标。

新想法:“完美课堂”蓝图

这篇论文引入了一种受神经崩溃(Neural Collapse)现象启发的新思维方式。

想象一下,当一名学生准备得完美无缺时,他的知识会变得超级有序。在人工智能领域,神经崩溃是一种 AI 大脑完美组织自身的状态:

  1. 所有“狗”的样本紧密地聚集在一起。
  2. 所有“猫”的样本紧密地聚集在一起。
  3. “狗”簇与“猫”簇之间的距离完全对称。

作者发现了一条优美的规则:在这种完美有序的状态下,每一个类别(狗、猫、树懒、甲虫)都应该具有完全相同的平均“分数”(损失)。 如果 AI 真正平衡,它就不应该在某个群体上比另一个群体更吃力。

解决方案:逆向推导(逆问题)

作者决定逆向推导,而不是猜测应该给罕见学生多少提升。

  1. 设定目标:“我们希望 AI 达到一种状态,即每个类别的平均损失完全相同。”
  2. 逆问题:“既然我们希望损失相等,那么我们需要现在应用哪些具体的乘数(权重)来实现这一目标?”

他们将此视为一个数学谜题(逆问题)。与其说“我认为我们需要权重 5",不如解方程:“为了获得相等的损失,权重必须是 X。”

他们发现了一个简单的闭式公式(直接的数学配方),可以精确计算出在训练过程的每一步中每个类别所需的权重。

两部分策略

该论文提出了一种两步“教师”策略来实现这一目标:

  1. 微观调整(按批次):每次 AI 查看一小群学生(一个“小批量”)时,它会精确计算需要给该特定组中的罕见学生提升多少,以平衡当前的分数。这就像老师根据当天在教室里的人,即时调整测验的难度。
  2. 宏观调整(频率):有时,“尾部学生”(罕见类别)在这些小组中出现的频率根本不够高。即使在他们确实出现时给予提升,他们在总体上获得的练习时间仍然较少。因此,作者增加了第二层:跟踪每个类别出现的频率。如果一个类别很罕见,就给予其一个永久的“奖励”,以补偿其出现频率较低的事实。

结果

当他们测试这种“逆重加权”方法时:

  • 更好的平衡:AI 不再忽视罕见类别。常见类别和罕见类别的“分数”(损失)变得更加平等。
  • 完美的几何结构:AI 的内部大脑结构看起来更像“完美有序”的神经崩溃蓝图。
  • 更高的分数:在标准测试(如 CIFAR-100 和 ImageNet)中,该方法击败了几乎所有其他现有方法,在许多情况下取得了最佳结果(最先进水平)。

总结

可以这样理解:旧方法就像一位老师猜测,“我会给那些安静的学生额外的加分,因为他们看起来很害羞。”而新方法则像一位老师说:“我知道目标是让每个人的平均分相同。让我计算出每个学生现在需要多少确切的帮助来实现这一目标,并且我会每天都进行调整。”

通过将问题转化为一个具有明确目标(相等损失)的数学方程,作者创造了一个系统,能够自然地引导 AI 达到完全平衡的状态。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →