← 最新论文
🤖 machine learning

Rényi Sharpness: A Novel Sharpness that Strongly Correlates with Generalization

本文引入了 Rényi 锐度(Rényi sharpness),这是一种基于 Rényi 熵的新型度量指标,用于表征损失 Hessian 谱的平均展宽,证明了其与神经网络泛化能力的卓越相关性,并由此实现了具有竞争力的 RSAM 正则化算法的开发。

原作者: Qiaozhe Zhang, Jun Sun, Ruijie Zhang, Yingzhuang Liu

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiaozhe Zhang, Jun Sun, Ruijie Zhang, Yingzhuang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,计算机通过调整数百万个微小的内部旋钮来学习解决问题,这一过程通常涉及在广阔而复杂的误差景观中寻找最低点。多年来,科学家们一直认为,这种景观的形状蕴含着为何某些学习模型在处理新数据时表现出色,而另一些则会失败的秘密。普遍的直觉是,模型如果能落在该景观中宽阔、平坦的谷底,其泛化能力会比那些处于陡峭、狭窄峰顶的模型更好。这种观点认为,平坦的极小值起到了缓冲作用,使模型能够容忍数据的微小变化而不至于性能崩溃。然而,近期的研究对这一简单的图景提出了质疑,发现传统测量谷底“平坦”或“陡峭”程度的方法往往无法预测模型的实际表现。用于测量这种景观的旧尺子似乎忽略了最重要的细节,导致出现了一些令人困惑的结果:即被一种度量标准判定为“平坦”的模型,实际上却是一个糟糕的泛化者。

华中科技大学的一个研究小组现在针对这一问题提出了一种新的观察方式,他们认为理解泛化的关键不在于谷底的平均深度或其最陡峭侧壁的高度,而在于地形本身的不均匀性。他们观察到,景观是由一个数值谱定义的,就像一段由许多不同音符组成的音乐和弦。其中一些音符非常响亮且数量稀少,另一些则较为细微但数量众多,还有一些几乎听不到。以往的方法只关注最响亮的音符或整个和弦的平均音量,忽略了那些较细微音符的具体分布。研究人员意识到,为了让模型实现良好的泛化,整个频谱需要保持平衡,不能有任何单一部分以一种导致不稳定的方式主导其他部分。为了捕捉这种微妙的平衡,他们转向了信息论中的一个概念——瑞利熵(Rényi entropy),这是一种旨在衡量一组数值分布不均匀程度的数学工具。

通过将这一概念应用于神经网络的内部结构,该团队定义了一种名为“瑞利锐度”(Rényi sharpness)的新度量标准。与那些可能会被模型的规模或特定构建方式所误导的旧度量标准不同,这种新度量标准无论模型的内部参数如何拉伸或偏移,都能保持一致性。研究人员证明,该度量标准在数学上与模型在训练数据上的表现与在未见过的全新数据上的表现之间的差距相关联。在实验中,他们在各种网络架构和数据集上测试了这一新度量标准,范围涵盖了从简单的图像识别任务到更复杂的视觉处理任务。他们发现,瑞利锐度对泛化性能的预测能力远优于现有方法,在以往度量标准失效甚至与现实相悖的地方,它展现出了强大且可靠的相关性。

为了将这种新理解投入实践,研究人员开发了一种名为“瑞利锐度感知最小化”(Rényi Sharpness Aware Minimization,简称 RSAM)的训练算法。该算法在学习过程中充当引导者,轻轻地将模型从具有不均匀内部数值频谱的解中引导出来,转向那些更加平衡的解。在面对面的对比测试中,这种新方法在提高泛化能力方面被证明比目前最先进的技术更为有效,而后者依赖于较旧且不够准确的景观平坦度测量方式。研究结果表明,通过关注模型内部值的完整分布而非仅仅关注极端值,我们可以构建出不仅更聪明、而且在面对现实世界时更加稳健的人工智能系统。这项工作提供了一张更清晰的学习景观地图,表明模型成功的秘密在于其整个内部结构的和谐,而不仅仅在于其最响亮的音符。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →