← 最新论文
🤖 machine learning

Overcoming Rank Collapse in Feedback Alignment

本文指出低维误差信号秩是阻碍反馈对齐(Feedback Alignment)扩展至深层网络的首要障碍,并证明将 Muon 优化器与隐藏层活动归一化相结合能有效增加更新的维度,从而显著提高在 CIFAR-100 等基准测试上的准确率。

原作者: Gauthier Boeshertz, Razvan Pascanu, Claudia Clopath

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Gauthier Boeshertz, Razvan Pascanu, Claudia Clopath

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:一种全新的 AI 教学方式

大多数现代人工智能(AI)都是使用一种叫做**反向传播(Backpropagation, BP)**的方法进行训练的。你可以把它想象成一位严厉的老师,在检查学生的作业时,发现错误后,会沿着学生思考过程的路径“倒着走回去”,精准地告诉学生哪一个具体的步骤出了错。为了完美地做到这一点,老师在发送反馈信号时,必须使用与发送课程时完全相同的“布线”(权重)。

问题在于,人类的大脑神经元并没有一种神奇的方式,能利用发送信息时所用的那套完全相同的线路来发送反馈信号。这使得反向传播在生物学上看起来并不像我们大脑实际学习时那样“符合生物学逻辑”。

反馈对齐(Feedback Alignment, FA)是一个被提出的替代方案。它不再使用完全相同的线路来发送反馈,而是利用随机且固定的线路将误差信号传回。令人惊讶的是,这种方法在处理简单任务时非常有效!随着时间的推移,AI 会学会将其“前向思考”的过程与这些随机的反馈线路进行“对齐”。

然而,这里有一个陷阱:FA 在处理小型、浅层网络时表现出色,但在面对深层且复杂的网络时却表现得一塌糊涂。 这就像一个学生虽然能解简单的数学题,但一旦遇到有 10 个步骤的复杂问题就会彻底迷失方向。

问题所在:“秩崩溃”(Rank Collapse,即交通拥堵)

论文作者想要探究为什么 FA 在深层网络中会失效。他们发现了一个被称为**“秩崩溃”(Rank Collapse)**的现象。

把 AI 的学习过程想象成一辆车试图在一个广阔且充满雾气的景观中探索,寻找最佳路线(即解决方案):

  • 反向传播 (BP): 这辆车拥有强力引擎,可以向任何方向行驶——向前、向后、向左、向右、斜向。它可以在整个地图中自由探索。
  • 反馈对齐 (FA): 在深层网络中,这辆车的引擎被卡住了。它只能在特定的几个方向上行驶。它的“秩”(或维度)发生了坍缩。

作者发现,在 FA 中,传回的误差信号变得是低维度的。AI 不再是在整张地图上探索,而是被迫只能在一条狭窄的直线上行驶。它被困在一个极小的解空间角落里,无法找到最优答案。信息的“交通”被挤压进了一条单行道,阻碍了 AI 学习复杂模式的能力。

解决方案:两种拓宽道路的方法

作者测试了两种方法来修复这个“交通拥堵”,从而迫使 AI 重新进行多方向的探索。

1. “正交化器”(Muon 优化器)

把 AI 的学习更新想象成一叠纸。在标准的 FA 设置中,这些纸都是皱巴巴的,并且都指向同一个方向。
作者使用了名为 Muon 的工具。你可以把 Muon 想象成一个神奇的“纸张整理器”,它能把那叠皱巴巴的纸强制让每一张都完美地直立起来,并且彼此之间相互垂直。

  • 它的作用: 它确保了每一种可能的学习方向都能得到平等的关注。它阻止了 AI 忽略“侧向”移动。
  • 结果: AI 现在可以重新探索整个景观,而不仅仅是那条狭窄的单行道。

2. “活动归一化器”(批归一化/Batch Normalization)

这种方法关注的是 AI “大脑”内部的“活动”(即神经元的放电情况)。
在深层 FA 网络中,神经元往往会同步放电,产生一种平淡、单调的信号(就像一个合唱团里每个人都在唱完全相同的音符)。
作者加入了批归一化(Batch Normalization, BN)。你可以把这想象成一位指挥家,他会对合唱团说:“嘿,你唱高音,你唱低音,你唱大声点,你唱小声点。”

  • 它的作用: 它迫使神经元变得多样且各具特色。这种多样性防止了信号坍缩成单一、微弱的方向。
  • 结果: 传回的误差信号变得更加丰富且多样化,从而让 AI 能够重新学习复杂的事物。

实验结果:无需“不可能”布线的深度学习

作者在困难的任务(如使用 CIFAR-100 数据集识别图像)上,使用深层网络(ResNet-18)测试了这两种方法。

  • 修复前: 带有 FA 的 AI 在处理难题时表现极差,准确率几乎为 0%。它完全迷失了方向。
  • 修复后: 通过使用 Muon、批归一化,或者将两者结合使用,FA AI 的性能大幅飙升。
    • 在一个数据集中,准确率提升了 9 个百分点
    • 在最难的任务中,结合使用这两种方法,让 AI 能够有效地学习,而此前它在这些任务上完全失败。

核心结论

论文总结道,FA 在深层网络中失效的原因不仅仅是因为随机线路,更是因为学习过程变得过于狭窄

通过使用那些能迫使学习过程变得更宽、更多样化(更高维度)的工具,我们可以让这种具有生物学合理性的方法,表现得像标准的、“不符合生物学逻辑”的方法一样出色。这就像是意识到学生并不是笨,他们只是需要一条更宽阔的道路。

重要提示: 作者强调,虽然这些方法让 FA 表现得更好,但他们使用的特定工具(如 Muon)是计算机的数学技巧,并不一定代表人类大脑的工作方式。然而,其背后的原则——即大脑可能需要保持其学习信号的多样性和高维度——或许是揭示人类大脑如何学习的一个重要线索。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →