← 最新论文
🤖 machine learning

Mechanisms of Width Scaling in Normalized Residual Networks: The Effective Alignment Dimension

本文引入了“有效对齐维度”作为一个可测量的量,用以表征激活梯度的信噪几何结构,并提供了一个有限样本理论界限以及经验证据,证明残差网络中更宽的模型通过增加该维度并减少训练数据与测试数据之间的梯度失配,从而提升了测试性能。

原作者: Jinhao Zhang, Zeyu Liu, Zicheng Yan, Yunquan Zhang, Guangming Tan, Fangming Liu, Daning Cheng

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinhao Zhang, Zeyu Liu, Zicheng Yan, Yunquan Zhang, Guangming Tan, Fangming Liu, Daning Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人识别猫。你给它看了成千上万张照片,它学会了。但如果你突然决定通过向它的内部线路中添加更多的脑细胞(神经元)来让机器人变得更“聪明”,会发生什么呢?在人工智能的世界里,这被称为“宽度缩放”(width scaling)。长期以来,科学家们一直认为,仅仅通过增加模型的宽度,就会自动提高它对从未见过的事物(比如一张新的猫的照片)的预测能力。这有点像认为只要往团队里增加更多的人,这个小组就必然能更快地解决问题。

然而,这里有一个陷阱。仅仅因为一个新的脑细胞有助于机器人学习你展示给它的照片(训练数据),并不意味着它能帮助机器人理解一张“新”的照片(测试数据)。有时,增加更多的细胞只会增加噪声或混乱,让机器人在预测未来时表现得更差。研究人员一直在追问的大问题是:我们如何在添加新细胞之前,就知道这些细胞究竟是会让机器人看得更清晰,还是只会让它更加困惑?

这篇论文深入探讨了正是这个谜团。作者们是一支来自中国的科学家团队,他们开发了一种衡量神经网络在扩张之前其“大脑健康状况”的新方法。他们将这种测量方式称为“有效对齐维度”(effective alignment dimension)。你可以把它想象成在航行前检查船只的指南针。如果指南针(来自训练数据的信号)指向的方向与风向(现实的测试数据)一致,那么增加更多的帆(宽度)将有助于船只航行得更快。但如果指南针在疯狂旋转或者指向错误的方向,那么增加更多的帆只会让船只原地打转。

研究人员发现,更宽的模型通常拥有一个更“锐利”的指南针。随着他们将 AI 模型做宽(特别是在观察 LLaMA、Pythia 和 ResNet 等模型时),他们发现“有效对齐维度”变得更大了。这意味着来自训练数据的信号变得更加可靠,并且与测试数据更加对齐。在实验中,他们展示了当这个维度较高时,更宽的模型产生困惑的可能性会显著下降。他们甚至通过物理手段,向模型添加了一个微小的、零初始化的“残差”(residual)块(即大脑的一小块额外部分)进行了测试。当对齐度良好时,模型在未见数据上的性能立即得到了提升。

因此,这篇论文并不仅仅是在说“越大越好”。相反,它提供了一个具体的、可衡量的证书——一个数学上的保证——告诉你在“何时”增加模型的宽度才会真正有所帮助。事实证明,宽度并不是一根会自动起作用的魔杖;它是一个只有在底层数据几何结构正确时才能发挥最佳作用的工具。通过测量这个“有效对齐维度”,我们可以高置信度地预测,扩大模型规模会导致突破,还是仅仅制造一个更大的混乱。作者指出,这种方法适用于不同类型的 AI,从编写故事的语言模型到识别猫的图像模型,为我们在不迷失方向的前提下,扩展数字大脑提供了一种可靠的新途径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →