← 最新论文
🤖 machine learning

How Far Can Sharpness and Complexity Jointly Explain Generalization?

本文通过采用基于帕累托(Pareto)的分析和面向函数的定义,研究了锐度(sharpness)与复杂度(complexity)对深度神经网络泛化能力的共同解释力,发现尽管这两个因素在多种设定下都显著增强了理解,但它们尚未构成一个完整的泛化理论。

原作者: Ziyu Cheng, Xitong Zhang, Longxiu Huang, Rongrong Wang

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyu Cheng, Xitong Zhang, Longxiu Huang, Rongrong Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图根据一个学生的学习方式来预测他在期末考试中的表现。在深度学习(人工智能)的世界里,研究人员长期以来一直怀疑,有两个主要因素决定了 AI 模型在处理新的、未见过的数据时的表现:

  1. 锐度(Sharpness): 模型有多“抖动”或敏感。如果我们稍微推动一下模型,它的答案会发生剧烈变化(锐利),还是保持稳定(平坦)?
  2. 复杂度(Complexity): 模型的内部规则有多“复杂”。它是一套简单的指令,还是一个庞大且纠缠不清的可能性网络?

长期以来,科学家们尝试使用一种观察模型原始代码(参数)的尺子来衡量这两个指标。但本文认为,用这种尺子去测量代码,就像是通过称量面粉和糖的重量来试图测量蛋糕的味道一样。这忽略了重点,因为你可以重新排列食材(改变代码),却不会改变实际的味道(函数)。

核心实验:一种新的测量方法

本文作者提出了这样一个问题:“如果我们正确地测量锐度和复杂度,我们能否解释几乎所有关于 AI 如何泛化的现象?”

为了回答这个问题,他们构建了两个新工具:

  1. “帕累托(Pareto)”检查: 他们不再仅仅画一条直线来观察数据是否拟合,而是观察“最佳权衡点”。想象一个图表,左下角是“完美区域”(低锐度、低复杂度)。他们检查了那些表现良好的模型是否聚集在那个完美的区域内。如果一个模型处于完美区域但表现依然很差,那么他们的理论就破产了。
  2. 面向函数的指标: 他们停止测量原始代码,转而开始测量“行为”。
    • 贝叶斯锐度(Bayes Sharpness): 他们不再检查代码的曲率,而是询问:“如果我们随机扰动模型的设置,它的实际输出会改变多少?”
    • 函数复杂度(Functional Complexity): 他们不再计算代码中连接的数量,而是询问:“与随机猜测相比,模型的行为有多么不同?”

他们的发现

1. 旧的尺子是有缺陷的(“无 Batch-Norm 问题”)
当他们在某些类型的 AI 模型(特别是那些没有使用名为“批归一化/Batch Normalization”的特定稳定层模型)上使用旧方法(测量原始代码)时,该理论失效了。根据旧尺子判断应该是优秀的模型实际上表现很差,反之亦然。这就像是一个预报晴天却下起雨来的天气预报。

2. 新的尺子基本解决了问题
当他们切换到这些新的“面向函数”工具时,该理论突然运作得更好了。

  • 在那些旧尺子失效的混乱、不稳定的模型中,新尺子能够正确识别哪些模型能够很好地泛化。
  • 他们甚至测试了将不同类型的 AI 模型混合在一起(比如把苹果和橘子混在一起)。旧尺子根本无法对它们进行比较,但新尺子可以成功预测哪些混合模型表现最好。

3. 理论尚不完美(“ViT 问题”)
然而,故事还有一个转折。当他们测试一种非常流行的现代 AI 类型——**ViT(视觉 Transformer)**时,新工具仍然失败了。

  • 为什么? 作者怀疑这些特定的模型过于自信且过度拟合了它们的训练数据,以至于它们本质上是在“产生幻觉”。它们已经完全脱离了正常学习的范畴,以至于没有任何简单的锐度和复杂度理论可以解释它们。
  • 当他们强迫这些模型变得不再那么极端(通过添加数据增强)时,理论开始重新生效,这表明失败是由于模型处于一种“损坏”的状态,而不是理论本身的失败。

总结

本文的结论是,锐度和复杂度确实是理解 AI 模型为何能泛化的强大视角

  • 成功之处: 通过基于行为而非代码来测量这些因素,该理论解释了大量关于 AI 发生的事情。
  • 局限性: 它还没有解释所有事情。在某些情况下(如 ViT 模型),该理论仍然会失效。

核心观点: 作者并不是在说“锐度和复杂度是唯一重要的因素”。他们是在说,“如果你以正确的方式测量它们,它们所解释的内容比我们想象的要多得多。但我们仍有工作要做,以理解那些异常值。”

这就像是意识到身高和体重是预测跑步速度的极佳指标,但在做出完美预测之前,你仍然需要检查一下跑者是否腿部受伤。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →