← 最新论文
🤖 machine learning

Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias

本文表明,训练好的深度网络的实用归纳偏置不仅由其架构决定,还取决于训练动态(具体而言是学习率、优化器选择以及正则化)如何过滤或抹除对随机初始化的记忆,其中低学习率的随机梯度下降保留了这种初始偏置,而自适应方法和显式的范数控制则有效地将其抹除。

原作者: Mohua Das, Pierfrancesco Beneventano, Shibshankar Dey, Gareth H. McKinkey, Tomaso Poggio

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohua Das, Pierfrancesco Beneventano, Shibshankar Dey, Gareth H. McKinkey, Tomaso Poggio

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在聘请一位厨师来烹制一道复杂的菜肴。你提供了一套特定的食材(初始化)和一份食谱(训练流程)。

这篇论文提出了一个简单却深刻的问题:菜肴最终的口味,究竟取决于厨师在最初切洋葱的具体方式,还是烹饪过程本身会抹去这些初始差异?

在人工智能的世界里,“切洋葱”被称为初始化。它是神经网络在学习任何内容之前的随机起点。而“烹饪过程”则是训练,即网络从数据中学习的过程。

以下是该论文的发现,拆解为日常概念:

1. 厨师的“记忆”

研究人员引入了一个名为“初始化记忆”的概念。这是一种衡量最终的人工智能在多大程度上仍“记得”其随机起点的方法。

  • 高记忆:最终人工智能的表现高度依赖于其启动方式。如果你从一个略有不同的随机种子开始,人工智能就会变成一位完全不同的(且可能更差的)厨师。
  • 低记忆:最终人工智能会遗忘其起点。无论最初如何切洋葱,烹饪过程都会将一切抚平,最终呈现出一道同样出色的菜肴。

2. 两种类型的厨师(优化器)

该论文测试了不同的“烹饪方法”(优化器),以观察哪些会遗忘,哪些会记住。

  • 缓慢、谨慎的厨师(低学习率 SGD)
    想象一位采取微小、谨慎步骤的厨师。论文发现,这位厨师会记住一切。即使经过长时间的烹饪并完美记住了食谱(训练准确率),最终的菜肴口味仍取决于食材最初是如何排列的。

    • 结果:如果你从一个“大”的随机切法开始,菜肴的味道可能很糟糕;如果你从一个“小”的切法开始,味道则很棒。这位厨师从未完全遗忘最初的混乱。
  • 自适应、快速的厨师(Adam, AdamW, Muon)
    想象一位根据所切食物调整刀速和压力的厨师。这些方法会非常快地遗忘起点

    • 结果:无论初始切法多么天差地别,自适应厨师都能如此完美地调整其技巧,以至于最终菜肴的味道几乎完全相同。他们“抹去”了起点的记忆。

3. 时间并不总是有帮助

一种普遍的观点是,如果你让缓慢的厨师(SGD)工作更长时间,他们最终会遗忘糟糕的起点。

  • 论文的发现。即使让缓慢的厨师工作 5,000 小时(轮次),他们仍然记得最初的切法。“糟糕的起点”会持续存在。
  • 解决方法:要让缓慢的厨师遗忘,你需要的不仅仅是更多时间;你需要改变烹饪的风格。你需要添加正则化(就像添加特定的香料或约束,例如 L2 权重衰减),或者用更大的步长(更高的学习率)进行烹饪。这些改变就像是一个“重置按钮”,能擦白板。

4. 遗忘的“时钟”

该论文认为,我们不应通过厨师工作的小时数(轮次)来衡量遗忘程度,而应通过施加的总“努力”或“正则化”量来衡量。

  • 把它想象成一桶水(起点的记忆)。
  • 慢速烹饪(低学习率)的桶上有一个微小的孔。水(记忆)泄漏得如此缓慢,以至于即使过了很长时间,桶仍然是满的。
  • 自适应烹饪添加权重衰减则创造了一个大洞。水迅速排干,桶很快变空(被遗忘)。

5. 主要启示

人工智能的“偏差”或“个性”不仅仅构建于其架构(锅和碗)之中。它还由训练过程如何处理其起点所塑造。

  • 如果你使用一种“健忘”的训练食谱(如 Adam 或带权重衰减的 SGD),人工智能就会变得稳健。无论你从幸运还是不幸运的随机种子开始,它都会学到同样的好解决方案。
  • 如果你使用一种“记忆”食谱(如没有额外辅助的慢速 SGD),人工智能就是脆弱的。糟糕的起点可能会毁掉最终表现,即使人工智能完美地学习了训练数据。

简而言之:该论文证明,良好的泛化能力(对新数据做出良好预测的能力)与训练过程“遗忘”其随机起点的能力紧密相连。帮助人工智能良好泛化的机制,正是那些使其遗忘初始化的机制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →