← 最新论文
🤖 machine learning

Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs

本文介绍了 ZO-Finetuner,这是一种基于学习的零阶优化器,它通过一种内存高效的设计自动学习高效的扰动策略,从而实现针对每个模型的单次训练,并在多样化的下游任务中相比现有的静态零阶方法表现出更优越的性能。

原作者: Kairun Zhang, Haoyu Li, Yanjun Zhao, Yifan Sun, Huan Zhang

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Kairun Zhang, Haoyu Li, Yanjun Zhao, Yifan Sun, Huan Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一座巨大且极其复杂的图书馆(即大语言模型,LLM),它懂得如何写作、推理和聊天。你想教这个图书馆一项新的、特定的技能,比如编写法律合同或解决数学问题。这个过程被称为“微调”(fine-tuning)。

通常,教导这个图书馆需要一种非常昂贵的方法,叫做“反向传播”(backpropagation)。这就像一位老师,在学生写完每一句话后,都必须走遍整个图书馆,检查每一本书,并精确计算出应该如何调整学生的脑回路。这种方法很准确,但它需要海量的内存和能量,往往使得在标准计算机上完成这项工作变得不可能。

为了解决这个问题,研究人员开发了一种“零阶”(Zeroth-Order)方法(例如 MeZO)。这种方法不再是走遍整个图书馆,而是像一位蒙着眼睛的探险家。探险家做一个微小的尝试(扰动),观察结果是变好了还是变差了,然后朝着相反的方向再做一个微小的尝试。通过比较这两个结果,他们可以在从未见过全貌的情况下,判断出前进的方向。这节省了大量的内存。

问题:“一刀切”的地图
现有的蒙眼探险家使用一种固定的、随机的策略。他们根据一个标准的、枯燥的规则(比如掷一个公平的骰子)来猜测方向。这种方法效率低下。有时,图书馆中存在特定的“房间”(参数块),在这些房间里你需要非常精准;而在其他房间里,你可以更大胆一些。固定的策略并不知道这一点;它把图书馆的每个部分都视作同等对待。

解决方案:ZO 微调器(聪明的探险家)
作者创建了 ZO 微调器(ZO Fine-tuner),这是一个“学会如何学习”的系统。他们没有使用固定的规则,而是训练了一个微小的、极其高效的“教练”(一个小型的神经网络)来教导这位蒙眼的探险家如何更好地进行猜测。

以下是它的运作方式,使用了几个类比:

  1. 教练(ZO 微调器): 想象一位教练在观察探险家。教练不需要看到整个图书馆。相反,教练会观察一些简单的统计数据:“这个房间现在有多乱?”以及“上一次的尝试是有利还是有害?”基于这些信息,教练会告诉探险家:“在这个特定的房间里,迈出大胆的一步。而在那个其他的房间里,迈出小心翼翼的一小步。”
  2. 块策略(The Block Strategy): 图书馆规模庞大(拥有数十亿个参数)。如果教练试图为每一本书单独提供指令,速度会太慢且极其耗费内存。然而,研究人员注意到,图书馆是按“块”(类似于书籍的分区)组织的。因此,教练学会了为每个块提供一条指令。这就像是一位教练告诉整个团队的队员如何协同移动,而不是对着每一个单独的队员大喊大叫。这让内存占用保持在极低的水平。
  3. “训练一次,广泛复用”的魔力: 通常情况下,你必须为每个新任务训练一个新的教练。但作者发现了一个惊人的事实:无论你是在教数学还是在教写故事,图书馆的“形状”变化并不大。因此,他们仅在单个数据集(COPA)上训练了一次教练,然后就带着同一个教练去教导图书馆处理完全不同的任务(如情感分析或阅读理解),甚至是不同版本的图书馆。
    • 结果: 在一个任务上训练出的教练,在所有其他任务上也表现得惊人地好。这就像是在特定的赛道上训练了一名司机,然后让他能在完全不同的公路上完美驾驶,而无需任何新的练习。

实验结果
论文在四个不同的语言模型和七个不同的任务上进行了测试。

  • 性能: 在大约 82% 的案例中,这个新的“聪明探险家”比旧有的“固定规则”探险家更快地达到了更好的结果。
  • 效率: 它不需要额外的太多内存。这个“教练”本身非常小(对于一个 300 亿参数的模型,其大小不到 2MB),就像是在一本 60GB 的百科全书里添加了一页笔记。
  • 稳定性: 新方法对“学习率”(即步长的大小)的敏感度也较低。即使你告诉它要迈大步,它也不会像旧方法那样容易崩溃。

总结
这篇论文介绍了一种无需超级计算机即可教导巨型 AI 模型新技能的方法。他们用一个微小的、聪明的教练取代了僵化、随机的猜测策略,这个教练学会了如何针对模型的不同部分给出正确的猜测方向。一旦这个教练被训练好,就可以高效地复用来教导模型完成许多其他任务,从而节省了时间和计算机内存。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →