← 最新论文
🤖 machine learning

Beyond 2\ell_2-norm and \ell_\infty-norm: A Curvature-Inspired p\ell_p-Norm Scheme for Deep Neural Networks

本文提出了一种受曲率启发的、具有动态衰减 pp 参数的 p\ell_p 范数优化方案,该方案从抑制高曲率主导地位过渡到实现稳定更新,从而产生了实现 O(T1/2)O(T^{-1/2}) 收敛并在各种深度神经网络架构和数据集上提升泛化能力的 LPSGD 和 LPSGDM 优化器。

原作者: Jianhao Xu, Zhuang Yang

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianhao Xu, Zhuang Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:在变化的景观中航行

想象一下,你正试图引导一辆沉重的推车沿着山坡向下行驶,目标是到达山谷的最底部(即 AI 模型的完美解)。这座山的起伏地形就是深度神经网络(DNN)的“损失景观”(loss landscape)。

问题在于,随着你的行进,这座山的形状也在发生变化:

  1. 在山顶阶段(训练初期): 地形狂野且崎岖。有些路径是极其陡峭的悬崖(高曲率),而另一些则是平缓、平坦的斜坡(低曲率)。
  2. 在山底阶段(训练后期): 地形变得平滑。悬崖消失了,地面变得相对平坦且均匀。

论文指出,我们通常用来引导推车的工具(优化器)由于只能使用一种类型的轮子,导致在一种情况下表现出色,但在另一种情况下却表现糟糕。

问题所在:两种糟糕的轮子

作者解释说,目前的 AI 训练方法通常依赖于两种“几何结构”(即测量距离和方向的方式):

  1. 2\ell_2 范数(标准轮):

    • 工作原理: 它根据推力的力度大小,平等地对待每一个方向。
    • 缺陷: 在崎岖的山顶,这种轮子会陷入困境。如果某个方向存在陡峭的悬崖,轮子会感到“恐惧”并减慢所有方向的速度以避免坠落。它忽略了那些可以快速移动的平缓斜坡。这就像开着一辆制动过于敏感的汽车,只要遇到一个小颠簸,刹车就会锁死,导致无法在平直路段加速。
  2. \ell_\infty 范数(“符号”轮):

    • 工作原理: 它完全忽略推力的力度大小,只看方向(左或右,上或下)。它在每个方向上都采取步长完全一致的步伐。
    • 缺陷: 这在崎岖的悬崖地带表现出色,因为它不在乎陡峭程度,只管向前推进。然而,一旦到达平坦的山谷底部,这个轮子就变得毫无用处了。因为它在每个方向都采取同样大的步长,它会开始在谷底来回跳动(振荡),无法温柔地停留在谷底的最深处。

解决方案:“变形”轮

作者提出了一种名为 p\ell_p 范数调度(p\ell_p-norm scheduling) 的新方法。他们并没有选择其中一种轮子,而是制造了一个能根据所处位置改变形状的**“变形轮”**。

  • 策略: 他们使用“余弦调度”(一种平滑的、波浪式的曲线)来随时间改变轮子的形状。
    • 早期阶段(崎岖的山顶): 轮子的形状开始像 \ell_\infty 范数一样。它忽略极端的陡峭程度,高效地穿过崎岖地形,防止了“锁死”问题。
    • 后期阶段(平坦的山谷): 随着训练的进行,它会平滑地演变成标准的 2\ell_2 范数形状。现在地面变平坦了,它可以采取精确、轻微的步伐,在不产生跳动的情况下,完美地停留在最低点。

你可以把它想象成登山者的鞋履:

  • 在开始阶段,他们穿着带有尖刺的坚固靴子,以抓牢岩石崎岖的悬崖并保持前进。
  • 当他们到达底部的平坦草地时,他们换上了柔软、灵活的拖鞋,以便安静地行走,并在不绊倒的情况下找到田野的正中心。

他们如何证明其有效性

论文并不仅仅是靠猜测,他们做了两件事:

  1. 数学证明: 他们利用数学证明了这种“变形”方法保证最终能找到谷底,并且精确计算了到达该处所需的时间。
  2. 现实测试: 他们将新的优化器(命名为 LPSGDLPSGDM)应用于著名的图像数据集(如 CIFAR 和 ImageNet)以及标准的 AI 模型(如 ResNet)。
    • 结果: 他们的“变形”方法始终优于标准方法。它在初期学习得更快,并在结束时实现了更高的准确率。例如,在一次测试中,它比现有的最佳方法提高了近 2% 的准确率——这在 AI 领域是一件了不起的大事。

总结

简而言之,这篇论文的核心观点是:“不要用单一的工具完成所有的工作。”

训练 AI 就像穿越一个从崎岖山脉到平坦平原不断变化的景观。作者创建了一个智能优化器,它先进入“无惧攀爬”模式,然后平滑过渡到“精准行走”模式。这使得 AI 能够学习得更快,并最终获得比使用单一、不变的方法更聪明、更准确的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →