← 最新论文
🔢 mathematics

RanSOM: Second-Order Momentum with Randomized Scaling for Constrained and Unconstrained Optimization

本文提出了 RanSOM,这是一个统一的优化框架,它通过采用随机步长和 Stein 型恒等式来消除动量方法中的曲率诱导偏差,从而在不需昂贵辅助采样的情况下,为约束和无约束问题实现最优收敛速率。

原作者: El Mahdi Chayti

发布于 2026-05-18
📖 1 分钟阅读🧠 深度阅读

原作者: El Mahdi Chayti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《RanSOM:用于约束与非约束优化的随机缩放二阶动量》的通俗解释,采用类比方式呈现。

核心难题:“过时的地图”

想象你在浓雾中徒步下山(这代表训练复杂的 AI 模型)。你希望尽快抵达山脚。

标准的徒步策略(称为动量方法)是这样的:你观察脚下的坡度,迈出一大步,然后凭借惯性继续朝同一方向走一段,因为你已经积累了速度。这对于平滑笔直的道路非常有效。

然而,山脉是弯曲的。当你行走时,地面会倾斜和扭曲。你刚才行走的方向(你的“动量”)现在过时了。它指向的是地面曾经所在的方向,而非现在的方向。这产生了一种“偏差”——因为你的地图已过时,你正在朝错误的方向推进。在 AI 领域,这会导致训练停滞或进展极其缓慢。

旧有的修复方案:昂贵或有缺陷

科学家们曾试图解决这个“过时地图”的问题,但他们面临两个主要问题:

  1. “双重检查”法:有些人尝试先迈第二步来探测新地形,然后修正路径。这虽然有效,但使工作量翻倍,导致徒步速度减半。
  2. “完美天气”假设:其他方法假设山脉是完美平滑且可预测的。但真实的山脉(以及 AI 模型)是崎岖不平且不可预测的。一旦地形变得崎岖,这些方法就会失效。

新解决方案:RanSOM(“随机步长”)

作者提出了一种名为RanSOM的新方法。他们建议不再迈出固定且可预测的步长,而是迈出随机步长

可以这样理解:与其说“我将精确向前行走 1 米”,不如说“我将行走一个随机的距离,但平均而言是 1 米”。你可能迈出微小的一步,也可能进行巨大的跳跃,但平均值保持不变。

为什么随机性有帮助?
这是其中的魔法所在。通过使步长随机化,数学原理允许徒步者利用一个巧妙的捷径(称为“斯坦恒等式”),无需进行昂贵的“双重检查”步骤,就能精确计算出地形扭曲了多少。

这就像拥有一把魔法指南针,只需观察你在随机跳跃后落地的位置,就能告诉你“地面倾斜了 X 量”,而无需攀爬梯子去四处张望。

两种场景下的运作方式

该论文根据地形提供了两种徒步策略版本:

1. RanSOM-E(适用于开阔地带 / 非约束优化)

  • 场景:你在一片开阔的田野中,可以随意行走。
  • 技巧:你使用指数分布来决定步长。这意味着你通常迈小步,但偶尔会进行非常长的飞跃。
  • 结果:这使得 AI 能够利用随机飞跃的数学特性即时修正方向,保持高速且路径准确。

2. RanSOM-B(适用于围墙花园 / 约束优化)

  • 场景:你在一个有围栏的花园里。你不能走到墙外。如果你随机飞跃,可能会撞墙。
  • 技巧:你使用贝塔分布。这是一种特殊的随机性,能保证你的每一步都落在花园内部,绝不会超出范围。这就像一次“安全的随机漫步”。
  • 结果:你获得了与开阔地带相同的速度和准确性优势,但永远不会违反花园的规则(即约束条件)。

为什么这很重要?

该论文声称取得了三大胜利:

  1. 速度快(无额外工作):与之前需要额外“前瞻”步骤(这会拖慢速度)的方法不同,RanSOM 利用原本就计划迈出的那一步进行修正。它免费获得了“二阶”(曲率)信息。
  2. 鲁棒性强(应对崎岖地形):即使山脉崎岖不平(非平滑)或雾气混乱(重尾噪声),它依然有效。它不需要旧方法所依赖的“完美天气”假设。
  3. 理论上的最快速度:从数学上,他们证明了该方法即使在困难条件下,也能以理论上可能的最快速度抵达山脚。

现实世界测试

作者在数字“山脉”(如 MNIST1D 和 MovieLens 数据集)上测试了该方法。

  • 结果:他们的方法(RanSOM)比当前最佳方法(如 STORM 或 Muon)爬升得更快、更平稳。
  • 观察:当其他方法踉跄摇晃(不稳定)时,RanSOM 保持了稳定且快速的节奏,证明了“随机步长”技巧在实际中确实有效。

总结

RanSOM 是一种训练 AI 的新方法,它通过迈出随机步长来解决“方向过时”的问题。这种随机性充当了数学捷径,使 AI 能够即时修正路径,而无需进行额外工作或依赖完美条件。它更快、更稳健,并且既适用于开阔空间,也适用于受限区域。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →