On the Infinite Width and Depth Limits of Predictive Coding Networks
本文研究了预测编码网络在无限宽度和深度极限下的表现,推导出了能够防止训练爆炸的稳定参数化方法,并证明了在宽网络中预测编码梯度会收敛至反向传播梯度,从而为深度架构提供了一种具有生物学合理性的局部学习机制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一群由多层机器人组成的庞大团队如何解开一个谜题。在人工智能领域,实现这一目标的标准方法被称为“反向传播”(backpropagation)。这就像是一个严厉的经理站在流水线的最末端,看着最终出现的错误,然后一路跑回起点,向每一个机器人大声喊出具体的指令,告诉他们到底哪里做错了。这种方法对计算机来说非常有效,但它与自然界运作的方式不同。真实的大脑并没有一个站在末端向后传递指令的中央经理;相反,每个神经元只知道其直接邻居正在做什么。
于是,“预测编码”(Predictive Coding)理论出现了,它建议大脑的学习过程更像是一群朋友在尝试预测天气。每个人(神经元)根据邻居的话做出预测,如果猜错了,就会感受到一点点“误差”,并调整自己的活动以更好地融入整体。一旦大家不再争吵并达成平静的共识(平衡状态),他们就会微调自己的连接,以便下次做得更好。这种方法在生物学上是合理的,因为每个人只与邻居交流,但长期以来,科学家们并不确定这种方法是否能处理现代人工智能所需的超大规模深度网络。这种“局部且话痨”的方法真的能扩展到超级计算机的大小,还是会分崩离析?
这篇论文深入探讨了这样一个问题:当我们让这些网络变得无限宽(增加大量的并列神经元)且无限深(增加大量的层级)时,会发生什么?研究人员 Francesco Innocenci、El Mehdi Achour 和 Rafal Bogacz 想要知道:我们能否通过调节这些预测编码网络的“旋钮”,使其能够像我们今天使用的标准反向传播网络那样保持稳定并进行有效学习?
他们的调查揭示了一个令人惊讶的转折。他们发现,为了让预测编码在大规模应用中发挥作用,它必须使用与标准反向传播方法完全相同的设置和缩放规则。如果你尝试使用大多数人在 PyTorch 等软件中使用的“标准”设置,预测编码网络输出将会像离麦克风太近的音箱一样,随着网络变宽而陷入混乱。然而,如果你切换到一组特定的、具有数学精确性的规则(被称为“均值场”或“最大更新”参数化),网络就会趋于稳定。
在这些稳定的条件下,论文表明,随着网络变得极其宽阔,预测编码的学习方式与反向传播几乎无法区分。事实上,对于那些比深度更宽的网络(想象成一个宽而浅的煎饼,而不是一个高而窄的塔),预测编码的“局部”更新与反向传播的“全局”更新完美对齐。作者在简单的线性网络中通过数学证明了这一点,并通过在卷积神经网络(CNN)和 Transformer 等复杂非线性模型上的实验证实了这一结论。
该研究还排除了几种令人兴奋的可能性。它指出,一些研究人员在深度大于宽度(deep networks)的模型中观察到的“快速”学习速度,实际上是由不稳定性造成的错觉;那些设置随着网络增长而失效。此外,虽然论文暗示大脑可能使用类似于预测编码的局部学习规则来实现反向传播的力量,但它指出,只有当大脑“比深度更宽”时,这种方式才能高效运行——这一假设符合目前对大脑皮层的生物学理解。
最终,这项工作不仅仅是说“预测编码可行”;它为“如何使其可行”划定了一个严格的界限。它告诉我们,要将这种具有生物合理性的方法扩展到现代人工智能的规模,我们不能只是随机调整,而是必须采用使标准 AI 奏效的那套严密的数学缩放规则。这是向前迈出的关键一步,表明大脑确实可能正在利用一种局部的、能量最小化的舞蹈,来解决与我们通过全局反向传播训练的计算机所解决的同样复杂的难题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。