← 最新论文
🤖 machine learning

Percolation Dynamics in Optimization : Variance Cascades and Discrete Scale Invariance

本文将随机梯度下降动力学建模为一个渗流过程,其中架构对称性通过离散且同步的块合并驱动更简单子网络的形成,并表现为在重尾噪声下同样适用于 Adam 和 AdamW 的方差峰值与缩放级联。

原作者: Sai Niranjan Ramachandran, Suvrit Sra

发布于 2026-09-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Sai Niranjan Ramachandran, Suvrit Sra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

深度学习彻底改变了机器学习的方式,然而神经网络在训练过程中的内部旅程仍然是一个黑盒。我们知道这些系统始于数百万个可调节的旋钮,即参数,并通过被称为“训练”的过程来调整这些旋钮以解决问题。这种调优的一种常用方法是随机梯度下降,这是一种通过一次观察一小块随机数据片段来推动网络向更好解迈进的技术。多年来,研究人员观察到这一过程自然地将网络推向更简单、更高效的结构,通常在没有被明确告知的情况下丢弃不必要的复杂性。这种被称为“隐式偏置”的现象表明,训练方法本身就像一位雕塑家,通过雕刻掉多余的材料来显现出核心结构。然而,这种雕刻是如何发生的精确机制——究竟是平滑、渐进的侵蚀,还是系列突然、剧烈的转变——一直以来并不明确。理解这一过程至关重要,因为它可以解释为什么神经网络有时似乎在长时间内完美地记忆数据,然后突然“开窍”并学会泛化,这种行为困扰了科学家多年。

一支研究团队现在绘制了这段隐藏的旅程,揭示了神经网络坍缩成更简单形式的过程并非平滑的滑动,而是一系列突然且同步的跳跃。通过将训练过程视为一个物理系统,其中网络的各个部分相互合并,作者发现这些合并是以离散块的形式发生的,而不是一个接一个地进行。想象一下一大群人在房间里,他们正缓慢地寻找同一个位置;在这种新的视角下,他们并不是单独到达的。相反,整个群体在同一时刻到达,并在一次事件中融合在一起。研究人员使用物理学中的一个概念来模拟这种行为,即“渗透”(percolation),该概念描述了流体如何流过多孔材料,或者连接如何在网络中形成。他们发现,神经网络本身的架构迫使这些群体同时合并,从而产生一种贯穿整个系统的突然结构变化的模式。

为了揭示这一模式,研究人员开发了一个数学框架,用于追踪网络参数随时间漂移和扩散的运动。他们专注于网络中不同的部分——这些部分最初是独立的——最终如何被困在同一个简化的状态中。当这些部分合并时,它们会形成一个更大的统一块。研究人员表明,由于网络设计中内置的对称性,这些块不能一个接一个地合并。相反,它们必须以两个、三个或更多个为一组同时合并。这创造了一种“方差级联”(variance cascade),即系统中不稳定性的一系列峰值,标志着这些重大的结构转变。通过测量在许多不同训练运行中的网络行为波动,团队能够检测到这些峰值,并看到一个清晰的、重复的模式。这些峰值之间的时间间隔遵循严格的几何规则,即每次事件都发生在先前事件的可预测倍数上。这种被称为“离散尺度不变性”的模式就像是底层对称性的指纹,证明了网络是在高度组织化、循序渐进的方式下发生坍缩,而非混乱无序。

该研究不仅限于简单的模型,还将其思想测试在复杂的现实场景中,包括一个著名的现象——“顿悟”(grokking)。在顿悟现象中,一个针对特定逻辑谜题进行训练的神经网络会记忆训练数据数千步,表现出没有真正理解的迹象,然后突然且剧烈地提高解决新问题的能力。研究人员发现,性能的这种突然飞跃恰好与他们预测的级联的最后阶段相吻后。就在网络“开窍”进入泛化解之前,系统经历了一次最后的、大规模的拓扑转变,即剩余的复杂部分融合进一个简单的低秩结构中。这表明网络并不是在缓慢学习规则,而是在等待合适的时机,将其内部复杂性坍缩为正确的、简单的形式。团队还证明,只要系统中的噪声遵循特定的统计模式,这种机制对于现代人工智能广泛使用的先进训练方法(如 Adam 和 AdamW)同样适用。

这些发现为看待人工智能如何学习提供了一种全新的方式,将焦点从连续、平滑的优化转向一系列离散的、类相变事件。研究人员表明,这些转变并非随机事故,而是由神经网络的基本几何结构驱动的。通过追踪网络参数的相对方差,他们可以预测这些重大转变何时发生,观察系统在达到最终简化状态之前经历一系列不同的阶段。在模拟实验以及从简单的数学谜题到图像识别任务的各种数据集上,这种突然合并的预测模式始终出现。这项工作表明,通往这些机器智能的路径是由复杂性的突然、同步坍缩铺就的,网络通过一次果断的动作脱去其不必要的层级。这一洞察有助于研究人员更好地理解深度网络中学习的时机,并可能指导训练算法的设计,从而利用这些自然的、结构性的转变来实现更快、更可靠的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →