← 最新论文
🤖 machine learning

Learning Dynamics of Zeroth-Order Optimization: A Kernel Perspective

本文通过证明零阶优化在微调大语言模型时的成功源于其学习动态受经验神经正切核支配,且该核的近似误差取决于模型输出规模而非庞大的参数维度,从而解决了这一悖论并解释了其可扩展性。

原作者: Zhe Li, Bicheng Ying, Zidong Liu, Haibo Yang

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhe Li, Bicheng Ying, Zidong Liu, Haibo Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《零阶优化的学习动力学:一种核视角》的解释,使用通俗易懂的语言和类比进行翻译。

核心谜题:“盲人”与“明眼人”

想象你试图在一个广阔、迷雾笼罩的山谷中找到最低点(这就是训练人工智能模型的目标)。

  • 一阶(FO)方法:这就像一位带着指南针和地图的徒步者。他们能确切地看到“向下”的方向(梯度),并径直走向那里。这既快速又高效,但需要携带沉重的地图(计算梯度),如果山谷过于巨大,或者你身处一个无法看到地图的“黑盒”中,这就变得不可能了。
  • 零阶(ZO)方法:这就像一位盲人徒步者。他们没有指南针。相反,他们向前迈一小步,检查是否更低,然后向后迈一步,再次检查。通过比较这两个点,他们猜测哪个方向是向下的。这种方法“内存高效”,因为他们不需要沉重的地图,但传统数学认为这应该极其缓慢,尤其是当山谷巨大(高维)时。

悖论
多年来,数学教科书告诉我们,如果山谷巨大(如拥有数十亿参数的现代大型语言模型),“盲人徒步者”(ZO)将永远无法找到谷底。然而,在现实世界中,研究人员已成功使用这种“盲人”方法微调了这些巨型模型。这是如何可能的?

论文的解决方案:“影子”类比

作者通过不再从“所走步数”的角度,而是从**“学习动力学”**(模型置信度如何变化)的角度来审视这个问题,从而解决了这一谜题。

他们使用了一种称为神经切线核(eNTK)的工具。将 eNTK 想象为学习过程投射出的“影子”

  • “明眼人”徒步者(FO)投射出地形完美、详细的影子。
  • “盲人”徒步者(ZO)投射出的影子则是完美影子的投影版,略显模糊

论文认为,“盲人”方法之所以有效,是因为它不需要看到整个巨大的山谷就能投射出有用的影子。它只需要将影子投影到世界的随机低维切片上即可。

魔法技巧:“约翰逊 - 林登斯特劳斯”引理

论文依赖于一个名为约翰逊 - 林登斯特劳斯(JL)引理的数学概念。以下是类比:

想象你有一个巨大、复杂的 3D 雕塑(拥有数十亿参数的模型)。你想给它拍张照片,但你的相机只能拍摄 2D 图片。

  • 旧理论:你认为需要一台传感器与雕塑一样大的相机才能获得好照片。如果雕塑巨大,照片就会模糊且无用。
  • 论文的洞察:JL 引理指出,如果你从随机角度拍摄,即使照片比雕塑小得多,你实际上也能完美捕捉雕塑的本质关系

关键发现
这张“盲人”照片(ZO 学习)的质量取决于你拍摄了多少个随机角度(扰动),而不是雕塑有多大。

  • “扰动”(P):这是盲人徒步者为了猜测方向而戳地面的次数。
  • “输出大小”(V):这是模型给出的最终答案的大小(例如,语言模型的词汇表大小)。

论文证明,只要你戳地面的次数足够多(增加P),“盲人”徒步者的路径将与“明眼人”徒步者的路径几乎完全相同。关键在于,所需的戳地次数取决于答案的大小(V),而不是模型的大小(d)

三个主要结论

  1. 数戳地次数,而非模型大小
    “盲人”方法的成功不在于 AI 模型的巨大规模(可能是数十亿参数),而在于你进行的随机猜测(扰动)次数。如果你做出足够多的猜测,模型的学习效果将与拥有地图时一样好。

  2. 猜测的形状无关紧要
    “盲人”徒步者是在平滑的连续圆(高斯分布)中戳地,还是在尖锐的二元跳跃(拉达马赫分布)中戳地,这重要吗?论文表明这并不重要。两者几乎同样有效。“盲人”方法具有鲁棒性;只要噪声足够多,它并不关心噪声的具体形状。

  3. 为何它在巨型模型上有效
    这解释了 ZO 为何能在大型语言模型(LLM)上工作。尽管模型拥有数十亿参数(巨大的d),但输出词汇表相对较小(适度的V)。由于“盲人”方法的准确性取决于V而不是d,因此即使对于最大的模型,它依然高效且有效。

核心结论

这篇论文改变了故事。它指出,当你正确看待学习过程时,“维数灾难”(即大模型对盲人方法来说太难)是一个神话。

通过将学习过程视为几何投影,作者表明,只要给予足够的随机样本,“盲人”优化器可以像“明眼人”一样有效地学习。这无关乎山的大小,而在于你从多少个不同角度去观察它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →