Criticality in Neural Network Function Space through Wilsonian Fixed Points and Finite-Width Corrections
本文提出了一个威尔逊式框架,将有限宽度的神经网络解释为从高斯不动点涌现出的相互作用量子场论,其中临界性源于引入非高斯相互作用的有限宽度修正,从而将网络架构与训练动力学联系起来,以实现函数空间中复杂性、表达能力及类相行为的涌现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
深度学习改变了机器观察、说话和推理的方式,然而这些系统背后的数学机制对大多数人来说仍然是一个黑盒。在这层神秘感的中心,存在着一个基本问题:当神经网络学习时,内部究竟发生了什么?传统上,科学家将这些系统视为庞大的可调节参数集合,其目标是通过调整这些参数来最小化误差。然而,一种更抽象的观点正在兴起,该观点认为,理解神经网络不应通过其内部设置,而应通过它所能产生的函数的概率分布。在这种视角下,网络是一个可能性的生成器,其行为是由它所创建函数的形状而非其转动的特定旋钮来定义的。这种视角的转变使得研究人员能够应用统计物理学和量子场论的工具,来理解这些系统是如何自我组织的,特别是在它们极其宽阔或被推向稳定性的边缘时。
来自麦考瑞大学(Macquarie University)和查尔斯斯特特大学(Charles Sturt University)的一个研究小组采用了这种抽象观点,并开发了一个新的框架来解释神经网络的行为逻辑。他们提出,可以通过“临界性”(criticality)的视角来理解这些网络的行为,这是一种在物理系统中发现的状态,即物质处于有序与混沌之间的平衡点。在他们的分析中,他们将理想化的、无限宽的神经网络视为一个简单、可预测的基准,类似于一片平静、平坦的景观。随后,他们研究了当网络规模有限(有限尺寸)时会发生什么,这引入了微小的、复杂的相互作用,从而破坏了这种简洁性。研究人员认为,这些有限尺寸效应不仅仅是应当被忽略的技术误差,它们实际上是网络学习复杂模式并表达丰富行为的源泉。
他们的核心工作涉及重新诠释网络规模与复杂度之间的关系。多年来,该领域普遍的直觉是,增加更多参数会使系统变得更复杂且更难控制。作者对此提出了挑战,他们表明,用函数空间的语言来说,增加网络的宽度实际上简化了它的行为。随着网络趋于无限宽,其输出变得完全可预测,并遵循一种被称为高斯过程(Gaussian process)的简单统计规则,其中所有的复杂相互作用都消失了。在无限极限下,网络本质上是“自由”的,缺乏建模困难现实问题所需的复杂连接。研究人员指出,神经网络真正的力量来自于其层级的有限宽度,这重新引入了这些必要的相互作用。
为了理解这一点,作者使用了借鉴自物理学的“威尔逊方法”(Wilsonian approach),该方法研究系统在从不同尺度观察时如何发生变化。他们将无限宽极限识别为一个“不动点”(fixed point),即系统趋向于其中的稳定状态。现实世界网络中的有限宽度则充当了一种“摄动”(perturbation),即一种将系统从完美稳定性中推开的微小推力。研究人员将这些推力分为三类:有些会随着网络变宽而消退,有些会增长并主导系统,还有些则处于一个微妙的边界上,可以通过调节来创造临界行为。他们发现,神经网络中最有趣且最有用的特性——例如从有限数据中泛化以及学习复杂结构的能力——都是在网络运行于这一临界边界附近时涌现出来的。
论文提供了几种衡量这种行为的具体方法。研究人员展示了,随着网络变得更宽,其实际输出与理想的无限宽预测之间的差异会以一种特定的数学衰减方式呈现可预测的缩小。他们证明了网络的“连通”部分(代表不同输入之间复杂的非线性相互作用)会随着宽度的增加而变得更弱。这证实了过参数化(虽然常被认为是增加了复杂度)实际上是一个抑制这些相互作用并将系统推向更简单的、高斯态的过程。相反,具有有限宽度的网络保留了这些相互作用,使其能够摆脱简单的统计规则并捕捉现实数据的细微差别。
该研究的一个关键发现是对“混沌边缘”(edge of chaos)的重新定义,这是一个描述网络处于“过于僵化而无法学习”与“过于混沌而无法控制”之间边界的概念。作者将这一边界映射到他们的框架中,表明它对应于一个临界曲面,在该曲面上,输入与输出之间的相关性可以在许多层之后依然存在,既不会崩溃也不会爆炸。在这种近临界状态下,网络既足够敏感以学习新模式,又足够稳定以保留已学到的知识。他们认为,训练神经网络实际上是一个变形其底层统计结构的过程,将其从随机的起点移动到这些临界相互作用达到平衡的区域。
研究人员还探讨了泛化之谜,即为什么大型网络尽管拥有比训练样本更多的参数,却往往表现得更好。他们的框架表明,泛化发生于训练过程抑制了那些过度拟合训练数据的特定、噪声化的相互作用,同时保留了适用于现实世界的更广泛、稳定的结构。相比之下,过拟合是指网络放大了这些特定的、不稳定的相互作用。通过利用有效场论的视角,作者提供了一种区分有用复杂度与有害噪声的方法,并指出表现最好的网络是那些处于受控临界状态下的网络,即有限宽度效应足够强以保证表达能力,但又不至于导致不稳定。
最终,这项工作为理解神经网络提供了一套新的词汇,将焦点从参数数量转向了它们所产生的函数的结构。它表明,深度学习的神奇之处不在于拥有更多的旋钮可以转动,而在于找到一个合适的平衡点——在这个点上,系统既有足够的复杂度来进行学习,又有足够的简洁性来进行泛化。作者建议,未来的研究应侧重于直接测量这些临界属性,观察相关性和相互作用在训练过程中如何演变,而不仅仅是追踪损失函数。通过将神经网络视为相互作用的物理系统,这种方法为系统地理解人工智能如何学习开辟了道路,为基于临界性和尺度基本原理设计更好的架构和训练方法提供了路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。