← 最新论文
🤖 machine learning

Accelerating Zeroth-Order Spectral Optimization with Partial Orthogonalization from Power Iteration

本文提出了 ZO-MOPI,这是一种用于微调大语言模型的零阶优化方法,它通过采用基于幂迭代和动量子空间投影的部分正交化策略替代完全正交化来加速收敛,在保持具有竞争力的准确性的同时,实现了比最先进的 ZO-Muon 快 1.5 到 4 倍的收敛速度。

原作者: Jiahe Chen, Ziye Ma

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiahe Chen, Ziye Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《利用幂迭代部分正交化加速零阶谱优化》的通俗解释,辅以生动的类比。

宏观图景:在没有说明书的情况下调校巨型收音机

想象你拥有一台庞大而复杂的收音机(即大型语言模型或 LLM),上面有数十亿个旋钮。你希望将它调校到完美播放特定歌曲的状态(即为新任务进行微调)。

通常,工程师会使用“一阶”方法:他们观察旋钮,感受振动,确切知道该朝哪个方向转动以获得更好的音质。这种方法很快,但需要一个巨大且昂贵的控制室(大量的计算机内存)来容纳所有指令。如果你试图在智能手机或车载电脑这样的小型设备上调校这台收音机,你就没有那么多内存可用。

零阶(ZO)优化是一种“盲”方法。你不去感受振动,而是猜测一个方向,转动旋钮,然后听一听音乐是变好了还是变差了。你不需要那个庞大的控制室,因此它适合小型设备。然而,由于你是在猜测,这种方法极其缓慢且充满噪声。这就像试图通过随机旋转调谐盘来寻找完美的电台,并指望恰好落在正确的频率上。

问题所在:“嘈杂”的信号

研究人员注意到,虽然这种“盲”方法节省了内存,但它收集的信息非常混乱。

  • 真实信号:在一个理想世界中,转动旋钮的“最佳”方向是清晰且强劲的(就像响亮、清晰的声音)。
  • 零阶现实:由于该方法依赖于随机猜测,信号中充满了静电和噪声。这就像试图在飓风中听到耳语。

有一种名为 Muon 的新工具曾试图提供帮助。Muon 就像一个智能助手,它查看所有旋钮并说:“好吧,让我们整理这些方向,以免我们在弱方向上浪费能量。”它试图让所有方向变得同样强劲。

关键问题:Muon 是为“理想世界”(一阶)设计的。当研究人员尝试将 Muon 用于“嘈杂”的零阶数据时,情况反而变得更糟。因为数据充满了静电,Muon 试图增强所有东西,包括噪声。这就像把一台只播放静电的收音机音量调大;噪声变得比音乐还响亮。

解决方案:“部分正交化”(选择性过滤器)

作者 Jiahe Chen 和 Ziye Ma 提出了一种名为 ZO-MOPI 的新方法。他们的秘诀在于部分正交化

他们决定不再尝试整理每一个方向(其中包含那些嘈杂且无用的方向),而是只关注那些实际上强劲且清晰的前几个方向。他们忽略了其余的噪声。

可以这样理解:

  • 旧方法(Muon):你有一桶混合了沙子、泥土和金粉的水。你试图完美地分离所有东西。结果你浪费了大量时间在筛选泥土上。
  • 新方法(ZO-MOPI):你意识到金粉很重,会沉到底部。你只需舀起底层(强信号),忽略漂浮的泥土(噪声)。你因此能更快地获得黄金。

他们是如何做到的:“流式幂”技巧

为了实现这种选择性过滤,他们使用了一种称为**流式幂迭代(SPI)**的技术。

想象你正试图在暴风雨的田野中寻找最强的风。

  1. 旧方法:你站定不动,测量每一阵风的 gust,然后试图计算平均风向。这耗时极长,而且风太混乱了。
  2. 新方法(SPI):你举着一面旗帜。你只关注那些最猛烈推动旗帜的阵风。你忽略那些几乎无法推动旗帜的微风。通过只关注强劲的推力,你可以迅速弄清楚风真正吹向哪个方向。

他们还添加了一个“动量”功能。这就像记住几秒钟前风是如何吹的。即使某一阵风是偶然(噪声),你对之前阵风的记忆也能帮助你保持稳定,不被混乱迷惑。

结果:更快的调校,相同的内存占用

研究人员在大型 AI 模型(如 OPT-13B 和 LLaMA3-8B)上,使用标准语言测试(SuperGLUE)测试了这种方法。

  • 速度:他们的新方法比当前最好的“盲”调校方法快 1.5 到 4 倍。它在更短的时间内达到了相同的准确度水平。
  • 准确度:最终质量与其他方法相同(甚至略好)。
  • 内存:它保持了相同的低内存占用,意味着它仍然可以在小型设备上运行。

总结

这篇论文介绍了一种在内存受限的设备上调校 AI 模型的更智能方法。新方法(ZO-MOPI)不像以前那样试图修正每一个嘈杂的猜测,而是像一个过滤器,只关注最强、最可靠的信号,忽略静电。这使得 AI 能够在不需要超级计算机的情况下更快地学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →