← 最新论文
💻 computer science

Efficient Zeroth-Order Federated Finetuning of Language Models on Resource-Constrained Devices

本文提出了一种新颖的零阶联邦学习方法,该方法将模型拆分为若干块并策略性地分配扰动,以实现中间激活值的有效复用,在保持联邦学习的内存和通信优势的同时,使资源受限设备上大型语言模型的微调计算需求降低了3倍。

原作者: Mohamed Aboelenien Ahmed, Kilian Pfeiffer, Ramin Khalili, Heba Khdr, Jörg Henkel

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohamed Aboelenien Ahmed, Kilian Pfeiffer, Ramin Khalili, Heba Khdr, Jörg Henkel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个巨大的、极其聪明的机器人大脑(大型语言模型),你想教它一个新技巧。通常,为了教这个大脑,你需要一台拥有海量内存和大量时间的超级计算机。但如果想用成千上万个小型、性能较弱的设备(如智能手机或智能家居设备)来教这个大脑,且永远不把它们的隐私数据发送到中央计算机呢?这被称为联邦学习(Federated Learning)

问题在于,这些小型设备太弱了,无法处理“反向传播”(标准的 AI 教学方法),因为这种方法需要存储大量的临时数据。如果它们尝试这样做,就会耗尽内存并导致崩溃。

旧方案:零阶优化(Zeroth-Order Optimization, ZO)

为了解决内存问题,研究人员开发了一种叫做**零阶优化(ZO)**的方法。

  • 类比: 想象你正试图在一个雾气弥漫的山谷中寻找最低点(即教导机器人的最佳方式),但你手里没有地图。传统的教学方法(反向传播)就像有一个 GPS,能准确告诉你哪边是下坡;而 ZO 方法则像是用棍子在地上试探。你向随机方向戳向地面,看看它是上升了还是下降了。
  • 代价: 为了获得关于哪边是下坡的准确信息,你必须在许多、许多个方向上进行试探。虽然这节省了内存(你不需要 GPS 地图),但由于你试探得如此频繁,过程会变得非常缓慢且计算成本极高。

新方案:FedSPZO

该论文的作者提出了一种名为 FedSPZO(联邦拆分扰动零阶优化)的新方法。他们发现了一种巧妙的方法,可以在不损失准确性的情况下,让这种“试探”过程变得快得多。

以下是他们是如何实现的,我们使用**“两阶段厨房”**来进行类比:

  1. 拆分厨房: 想象机器人大脑是一个有两个区域的厨房:

    • 区域 A(准备站): 一个巨大的区域,用于切碎和混合食材。这是模型的“第一块(first block)”。
    • 区域 B(烤箱): 一个较小的区域,用于最后的烹饪。这是“第二块(second block)”。
  2. 旧方法(低效): 为了弄清楚如何改进整个厨房,旧方法会随机改变整个厨房(包括准备站和烤箱),然后品尝食物。接着它会再次改变,然后再改。因为厨房很大,每次做微小的改变后都要品尝一次食物,这需要花费很长时间。

  3. FedSPZO 的做法(高效):

    • 第 1 步: 他们只对准备站(区域 A)进行轻微的改变。他们保持烤箱(区域 B)完全不变。
    • 第 2 步: 他们将准备站的输出送入烤箱,并在烤箱中进行许多、许多次运行,每次仅对烤箱进行微小的随机改变。
    • 神奇之处: 因为准备站没有改变,所以每当测试烤箱时,厨房都不需要重新“切碎”食材。他们可以直接重复使用已经切好的食材(中间激活值),并只专注于测试烤箱。
    • 结果: 与之前的相比,他们能以更少的总“品尝”步骤,更准确地掌握如何改进烤箱(以及间接改进准备站)。

他们发现了什么?

研究人员在几个著名的 AI 模型(如 RoBERTa、OPT 和 LLaMA)上进行了测试,发现:

  • 速度: 他们的这种新方法在计算量方面比其他类似的“试探”方法快了高达 3 倍
  • 内存: 它仍然使用极少的内存,非常适合像手机这样的微型设备,就像原始的“试探”方法一样。
  • 通信: 他们向中央服务器发送的数据量非常小(仅为数字,而不是整个大脑),这对于网络连接较慢的情况非常有利。
  • 准确性: 机器人的学习效果几乎与那些沉重的标准方法一样好,仅有极小的性能下降。

核心结论

可以将 FedSPZO 看作是一种聪明的方法,利用一群小型、弱性能的设备来教导一个巨大的机器人。他们并没有要求每个设备都进行大规模、耗费内存的计算,而是将任务拆分为两个部分。他们完成一次繁重的体力活,然后重复利用这项工作来快速测试许多微小的变化。这使得他们在通常无法胜任的设备上训练强大的 AI 成为可能,从而节省了时间、电池和数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →