← 最新论文
🤖 machine learning

On-Device Fine-Tuning via Backprop-Free Zeroth-Order Optimization

本文表明,通过消除对激活值和优化器状态的存储需求,内存高效的零阶优化(MeZO)能够在严苛的内存约束下,以牺牲更多实际运行时间为代价换取更高的精度,从而实现对比传统反向传播显著更大的模型进行设备端微调。

原作者: Prabodh Katti, Houssem Sifaou, Sangwoo Park, Bipin Rajendran, Osvaldo Simeone

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Prabodh Katti, Houssem Sifaou, Sangwoo Park, Bipin Rajendran, Osvaldo Simeone

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大且极其聪明的知识库(大型语言模型),并希望将其带到一个小型、电池供电的设备上,例如智能手机或智能手表。你希望该设备能够当场针对你的特定需求学习新技能,而无需连接云端的大型服务器。这一过程被称为设备端微调

问题在于,设备的“大脑”(内存)与知识库相比微不足道。

旧方法:“反向传播”背包

教导这些模型的传统方法称为反向传播(BP)。这就像一名学生试图通过学习新科目来备考:在参加完考试后,他们立即记录下解题过程中产生的每一个想法、草稿纸和中间计算步骤,以便日后回顾,找出错误所在。

  • 类比:想象你正试图在一张小小的餐巾纸上解决一道复杂的数学题。若要使用旧方法,你必须为问题的每一层都保留一份单独纸张,记录你采取的每一个步骤。
  • 结果:“餐巾纸”(你的设备内存)会瞬间被填满。由于必须保存所有这些中间笔记,你的设备上只能容纳非常小、非常简单的知识库。如果你试图携带一个巨大的知识库,甚至在开始学习之前就会因空间不足而失败。

新方法:"MeZO"直觉

这篇论文介绍了一种名为MeZO(内存高效零阶优化)的新方法。该方法不记录中间步骤,而是采用“试错” approach。

  • 类比:想象你试图在迷宫中找到最佳路线。与其绘制一张记录你每一次转弯的地图(这会占用大量纸张),不如迈出一小步,看看是否撞墙,然后朝不同方向再迈一小步,看看是否更好。你只需记住每一步的结果,而无需记住到达那里的整个思维过程。
  • 结果:你无需携带沉重的笔记背包。由于不再浪费空间在“草稿纸”上,你可以在设备上容纳大得多的知识库。

权衡:速度 vs. 规模

论文对这种权衡提出了非常具体的主张:

  1. 规模优势:由于 MeZO 无需存储所有那些中间笔记,你可以容纳比旧方法允许至少大 2 倍的模型。如果你进行长对话(即长“上下文”),这一优势会急剧扩大——可达25 倍

    • 简单数学:如果旧方法允许你容纳一个 30 亿词的词典,MeZO 可能允许你在同一设备上容纳一个 130 亿词的词典。
  2. 速度代价:缺点是 MeZO 速度较慢。因为它必须多次“猜测并检查”以确定正确方向(而不是直接查看笔记),所以学习过程需要更长时间。

    • 论文发现:在他们的测试中,旧方法学习迅速,但因被迫使用小模型而触及了“天花板”。新方法(MeZO)学习缓慢,但由于它使用的是更大、更聪明的模型,经过几小时后,最终达到了更高的准确率

实际测试内容

研究人员不仅进行了数学推导,还在强大的计算机芯片(H100 GPU)上运行实验以模拟设备环境:

  • 他们比较了使用旧“沉重背包”方法训练的小模型与使用新“轻量级”方法训练的大得多的模型。
  • 结果:尽管新方法耗时更长(约 2 小时才能获得良好结果),但它所训练的大模型明显更聪明(准确率为 82%),而快速训练的小模型准确率不到 75%。
  • 他们还测试了“稀疏”训练(仅更新模型“大脑”的 1%)。即使使用这一技巧,旧方法仍然比新方法需要更多内存,因为“草稿纸”(激活值)仍然是最大的问题。

核心结论

论文得出结论:如果你希望在内存有限的设备上运行真正智能的 AI,MeZO 是更好的选择。它允许你将一个“更大的大脑”带到边缘设备,前提是你愿意多花一点时间让它学习。它通过改变学习发生的方式,而非仅仅缩小模型,将“内存小”这一限制转化为优势。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →