On Adaptivity in Zeroth-Order Optimization
本文表明,标准自适应零阶优化器(如 ZO-Adam)在高维场景下因缺乏坐标梯度异质性,在内存受限的大语言模型微调中并未比 ZO-SGD 提供收敛优势,据此提出了 MEAZO,这是一种内存高效的替代方案,它仅跟踪单个标量以进行全局步长自适应,同时保持性能并提升鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和日常类比对论文《零阶优化中的自适应性》的解释。
全景:在没有说明书的情况下调校巨型收音机
想象你有一台拥有数百万个旋钮(这些是大语言模型,即 LLM 的“参数”)的庞大而复杂的收音机。你想把它调校到完美播放一首特定的歌曲(即对模型进行微调)。
通常,要调校收音机,你需要一本说明书,告诉你精确地朝哪个方向转动每个旋钮以及转动多少。在人工智能领域,这本说明书被称为梯度。计算这本说明书需要大量的内存和计算能力,既昂贵又缓慢。
零阶(ZO)优化是一个巧妙的技巧:与其阅读说明书,你只需随机轻推旋钮,倾听结果,看看音乐是变好了还是变差了。你通过向前和向后推动旋钮来猜测方向。这种方法在内存上便宜得多,但它是“有噪声的”,因为你在猜测。
问题:“过度设计”的指南针
长期以来,研究人员认为,由于这种猜测游戏充满噪声,你需要一个超级智能但极其消耗内存的指南针来帮助你。这就是自适应优化器(如 ZO-Adam)所做的。它们试图记住每一个旋钮的历史,以决定转动它的速度。它们为那数百万个旋钮中的每一个都保存一份单独的“记忆日志”。
论文的重大发现:
作者发现,在高维设置(如巨型 AI 模型)中,这种超级智能的指南针实际上是无用的。
- 类比: 想象你在一片迷雾笼罩的田野中,试图找到山谷的底部。
- 一阶(标准 AI): 你有一张清晰的地图,显示地面陡峭地向左倾斜,而向右则是平坦的。你需要针对每个方向采用不同的策略。
- 零阶(猜测游戏): 因为你在巨大且迷雾重重的空间中通过随机轻推来猜测,你猜测的“噪声”如此之大,以至于淹没了地形细节。信号在每个方向看起来都是一样的。就像迷雾太浓,地面看起来在任何地方都完美平坦且均匀。
- 结果: 由于“地形”在每个方向看起来都一样,为每一个旋钮保存单独的记忆日志就是浪费时间和内存。花哨的“自适应”方法(ZO-Adam)实际上并不能让你比简单的方法(ZO-SGD)更快地到达山谷底部。事实上,它们只是让你的背包变得更重。
解决方案:MEAZO(极简主义指南针)
既然花哨的指南针是不必要的,作者就构建了一个名为MEAZO的新工具。
- 工作原理: MEAZO 不是为每个旋钮跟踪数百万条单独的日志,而是为整个组跟踪一个单一的数字。它问的是:“当我们轻推所有东西时,平均而言音乐变化了多少?”
- 优势: 它保留了自适应方法的“智能”部分(根据地形感觉的粗糙程度调整轻推速度),但抛弃了沉重的包袱。
- 类比: 想象你在徒步旅行。
- ZO-Adam: 你携带 GPS、气压计、指南针,以及为你迈出的每一步准备的详细地图。这很沉重,你会感到疲惫。
- ZO-SGD: 你只是向前走。这很轻便,但如果道路变得崎岖,你可能会绊倒。
- MEAZO: 你携带一个简单的计步器,告诉你路径的平均陡峭程度。如果道路变得崎岖,你就放慢速度;如果道路平坦,你就加快速度。你不需要为每一块石头准备地图;你只需要知道小径的整体氛围。
实验结果
团队在真实的大语言模型(如 Llama 和 Qwen)和合成数学问题上测试了这一点。
- 性能: 当他们正确调整设置时,简单的方法(ZO-SGD)的表现与花哨的方法(ZO-Adam)一样好。
- 内存: MEAZO 使用的内存量与简单方法一样微小,而花哨的方法则使用了多得多的内存。
- 鲁棒性(“安全网”): 这是最重要的发现。虽然简单方法在你选择完美步行速度时表现很好,但如果你选择的速度太快或太慢,它就会崩溃。花哨的方法(以及 MEAZO)要宽容得多。如果你选择了一个“糟糕”的速度,MEAZO 仍然能让你到达目的地而不会撞毁。这就像一辆带有巡航控制并能自动适应坡度的汽车,而简单的汽车则保持固定速度行驶,可能会撞上颠簸。
总结
- 误区: “我们需要复杂且消耗内存的自适应工具,才能让零阶 AI 训练有效工作。”
- 现实: 在高维 AI 模型中,噪声使得地形看起来均匀,因此复杂的工具是内存的浪费。
- 修正: MEAZO 是一个新工具,它只跟踪一个全局数字,而不是数百万个。它使用极少的内存(像简单方法一样),但在设置方面更加稳定和宽容(像复杂方法一样)。
这使得研究人员能够在内存有限的设备(如边缘设备)上微调巨大的 AI 模型,而无需超级计算机,同时仍能获得稳定且高质量的结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。