← 最新论文
🤖 machine learning

The role of class encoding in neural collapse

本文研究了标签编码如何影响神经坍缩,证明了对于平衡数据上的独热编码标签,增加偏置正则化会导致未中心化的均值特征从单纯形等角紧框架向正交框架转变,同时也表明分类器的偏置通常起到使任意标签编码中心化的作用。

原作者: Bastien Massion, Roy Makhlouf, Estelle Massart

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Bastien Massion, Roy Makhlouf, Estelle Massart

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一群机器人(一个神经网络)将一堆乱七八糟的玩具分类到不同的箱子里。这些机器人有一个“大脑”(隐藏层)来处理玩具,还有一个“决策者”(最终分类器)来指向正确的箱子。

这篇论文研究了一个被称为**神经坍缩(Neural Collapse)**的奇特且美丽的现象。当这些机器人在工作中变得极其出色(错误率为零)时,它们的脑中会发生某种神奇的变化:来自同一个箱子的玩具在内部表示(internal representations)中开始聚集在一起,形成紧密、完美的群体。

以下是作者发现的简单拆解,使用了日常类比:

1. 两种组织形状

论文研究了这些玩具簇是如何排列的。他们发现,这种排列方式在很大程度上取决于两件事:箱子是如何标记的,以及决策者被允许“移动”多少位置

  • “正交”(Orthonormal)形状(网格): 想象机器人将玩具组排列得像完美正方形网格的角一样。每一组与其他组都呈直角。当决策者被强制保持在中心点(零偏差)时,就会出现这种情况。
  • “单纯形”(Simplex)形状(金字塔): 想象这些组排列得像一个完美的金字塔的角(如果只有三个组,则是一个三角形)。它们彼此之间的间距相等,但略微倾斜。当决策者可以自由移动时,就会出现这种情况。

重大发现: 作者意识到这两个形状其实并不是两个不同的世界。它们只是同一个形状,只是发生了位移

  • 把“网格”看作是放在桌子上的金字塔。
  • 如果你抬起整个金字塔(增加一个“偏差/bias”),金字塔的中心会移动,但各角之间的相对角度保持不变。
  • 论文表明,通过调节一个“正则化旋钮”(控制决策者允许移动多少),我们可以平滑地将机器人的大脑从“网格”形状滑动到“金字塔”形状。

2. “标签”的角色(箱子标签)

论文探讨了:我们如何在箱子上写名字重要吗?

  • 标准标签(One-Hot): 通常,我们用“1”代表正确的箱子,用“0”代表其他所有情况(就像一个电灯开关)。
  • 偏差的作用: 作者发现,决策者的“偏差”充当了一个补偿器。它的主要工作是确保所有标签的平均位置正好位于房间的正中间。
    • 如果你的标签本质上是居中的(平衡的),那么偏差就保持为零。
    • 如果你的标签偏离了中心(比如你使用了一种奇怪的编码系统),偏差就会发生偏移,以将整个系统拉回中心。这就像一个走钢丝的人通过调整手中的杆子来保持平衡。

3. 什么在改变,什么保持不变?

论文检查了改变标签(编码方式)是否会破坏神经坍缩的魔力。

  • “聚类”(NC1): 这部分是极其稳健的。无论你如何标记箱子或如何调整偏差,机器人始终会将相同的玩具聚集在一起。这就像是在说:“无论你如何给箱子涂漆,红色的车始终会停在红色区域。”
  • “完美对称性”(NC2): 在这里,标签起到了作用。只有当标签本身具有某种对称性时,完美的金字塔形状才会形成。如果你以一种奇怪的方式打乱标签,机器人可能无法形成那个完美的金字塔,尽管它们仍然会进行聚类。
  • “镜像关系”(NC3): 通常,决策者的权重看起来与这些聚类的玩具组完全一致(这种性质称为自对偶性/self-duality)。论文发现,如果旋转或翻转标签,这种镜像关系就会被打破。然而,它并没有真正被破坏;它只是旋转了。如果将决策者旋转回来,镜像关系就会回归。所以,这种联系依然存在,只是戴上了不同的帽子。

总结

简而言之,这篇论文解释了神经坍缩是一个非常稳定的现象。

  1. 机器人总是将相似的事物聚集在一起。
  2. 这些群体的具体几何形状(网格 vs 金字塔)受“偏差旋钮”和标签编写方式的控制。
  3. 偏差作为一个中心化机制,确保无论标签如何编码,系统都能保持平衡。
  4. 即使标签被打乱了,基本的“聚类”依然存在,并且组与决策者之间的关系只是发生了旋转,而非被破坏。

作者并没有提出新的医疗用途或未来的应用;他们只是绘制出了这些 AI 大脑在发挥最佳水平时如何组织自身的数学“几何学”图谱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →