← 最新论文
📊 statistics

The Tamed Subgradient Unadjusted Langevin Algorithm beyond Convexity

本文介绍了一种次梯度驯化非调整朗之万算法(SG-TULA),这是一种在无需平滑处理的情况下,能够处理具有超线性梯度增长的非光滑、非凸势能的新型采样方法,该方法实现了改进的非渐近收敛界限,并在大语言模型预训练中展示了与 AdamW 和 Muon 等标准优化器相比具有竞争力的性能。

原作者: Iosif Lytras, Nikolaos Makras, Sotirios Sabanis

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Iosif Lytras, Nikolaos Makras, Sotirios Sabanis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一片广袤且迷雾缭绕的山脉中寻找最深的谷底。这是一个在科学和技术领域随处可见的问题,从训练人工智能的大脑到研究晶体的结构皆是如此。目标是找到那个绝对的最低点——“全局最小值”,即能量最低、系统最稳定的地方。

为了实现这一目标,科学家们经常使用一种受物理学启发的算法,称为“朗之万算法”(Langevin algorithm)。你可以把它想象成向迷雾中派遣一名徒步旅行者。徒步者拥有一张地图(梯度),告诉他下坡的方向,但这张地图带有一些噪声。因此,徒步者在向下坡迈进的同时,还会受到一阵随机风力的推动(噪声)。这能帮助他从浅小的凹陷(局部极小值)中弹跳出来,并继续寻找最深的谷底。通常情况下,如果山脉平滑且坡度可预测,这种方法效果极佳。

但如果地形变成一场噩梦会怎样?如果地面是锯齿状且尖锐的(非光滑),如果坡度随着距离增加而变得越来越陡峭(超线性增长),如果景观充满了并非谷底的奇怪凸起(非凸性)会怎样?在这种混乱的条件下,标准的徒步者地图往往会失效。步伐可能会变得如此巨大,以至于徒步者完全飞出了地图;或者他会被困在一个地图无法提供方向的尖锐转角处。这正是现代人工智能训练面临的问题:神经网络的“山脉”是粗糙、陡峭且布满陷阱的。

本文介绍了一位更强壮的新型徒步者:SG-TULA(次梯度驯服非调整朗之万算法)。SG-TULA 并没有试图抹平那些锯齿状的岩石,也没有假装那些陡峭的悬崖不存在,而是为徒步者配备了一双特殊的“驯服靴”。这对靴子会自动调节徒步者的步幅。如果坡度变得过于陡峭,靴子会缩短步幅以防止跌落;如果地面很尖锐,靴子则会在边缘寻找一条安全的路径。作者在数学上证明了,这位新的徒步者能够成功地在这些混乱、锯齿状且无限陡峭的景观中穿行,找到最深的谷底,同时还能为这段旅程所需的时间提供精确的地图。

问题所在:当地图失效时

大多数优化算法(用于训练 AI 的工具)都依赖于一些令人安心的假设。它们假设地形是光滑的(没有尖锐边缘)、坡度不会太疯狂(线性增长),并且地形大致呈碗状(凸性)。但现实世界的 AI 模型,比如驱动聊天机器人的模型,打破了所有这些规则。它们的“景观”充满了尖锐的转角(来自 ReLU 等激活函数)、坡度可能会爆炸式增长(超线性增长),且地形充满了丘陵与谷底的混乱。

当你尝试在这样的地形上使用标准算法时,就像是派一名穿着巨大且僵硬靴子的徒步者进入一片仙人掌和悬崖地带。徒步者可能会迈出过大的步伐,飞出边缘,或者因为地面太粗糙而无法抓地,从而被困住。为了解决这个问题,人们曾尝试“平滑”地面(让仙人掌变软)或“裁剪”步长(强迫徒步者走慢点)。但平滑计算成本很高,而裁剪则是一种粗糙的手段,会扭曲路径。

解决方案:SG-TULA

作者提出了 SG-TULA,这是一种专门为这种混乱现实设计的全新算法。它不通过平滑地面或盲目裁剪步长,而是使用了一种称为“驯服”(taming)的技术。

想象一下,徒步者的步幅是由一根智能牵引绳控制的。当徒步者接近一个坡度变得危险的悬崖时,牵引绳会温柔而坚定地向后拉,仅仅缩短步幅,足以保证徒步者的安全。如果地面是锯齿状的,徒步者会使用“次梯度”,这就像是用拐杖探测地面,即使在地图失效时也能找到安全的方向。

其核心创新在于,这种“驯服”是自动且连续发生的。它不需要预设一个限制(如减速带)来防止徒步者在安全时移动得不够快。相反,步长会根据那一刻地面的陡峭程度进行自我缩放。这使得该算法能够处理:

  1. 非光滑性:坡度瞬间变化的锯齿状边缘。
  2. 超线性增长:趋于无穷陡峭的坡度。
  3. 非凸性:充满混乱凸起和虚假谷底的景观。

研究发现

作者不仅发明了这种算法,还证明了它的有效性。他们推导出了数学保证,表明 SG-TULA 最终会找到目标分布(最深的谷底)并停留于此。

  • 速度:他们精确计算了算法的收敛速度。在这些混乱景观的最坏情况下,误差以大约步长的 1/4 次方速率缩小。虽然这听起来很慢,但在处理这类特定问题时,这实际上比以往的方法有了显著进步,因为旧方法往往更慢甚至根本无法工作。
  • 常数:他们追踪了公式中的每一个数字,展示了维度数量(问题的规模)和“温度”(加入多少噪声)是如何影响速度的。
  • 现实测试:为了证明这不仅仅是理论,他们在名为 "nanochat"(一个著名的 GPT-2 简化版)的小型语言模型上测试了 SG-TULA。他们将其与两种最优秀的标准优化器 AdamW 和 Muon 进行了对比。
    • 在 12 层深度下,SG-TULA 在“每字节比特数”(衡量模型预测文本能力的指标)和名为 CORE 的评分方面取得了最佳结果。
    • 在更深的 24 层深度下,它依然保持竞争力,表现与顶尖对手不相上下。
    • 至关重要的是,他们是在没有“缩放法则”(通常用于辅助调节这些模型的经验法则)的情况下完成的,这表明该算法即使在需要手动调优时也具有鲁棒性。

为什么这很重要

这篇论文意义重大,因为它弥补了理论与实践之间的鸿沟。多年来,我们一直知道 AI 训练发生在混乱、非光滑、超线性的环境中,但我们的数学保证却一直停留在“完美世界”里——那里一切都是光滑且凸性的。SG-TULA 首次提供了严谨的证明,证明我们可以安全且高效地在这些混乱中穿行。

它表明,我们不需要假装世界是光滑的来解决问题。我们可以构建尊重数据本身具有的锯齿状、陡峭且复杂特性的工具。通过证明这种“驯服”方法是有效的,作者为我们提供了一种训练下一代 AI 模型的新型且可靠的方式,确保即使路径充满了尖锐转角和陡峭落差,它们也能找到最优解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →