← 最新论文
🤖 AI

Shard the Gradient, Scale the Model: Serverless Federated Aggregation via Gradient Partitioning

本文提出了 GradsSharding,一种通过将梯度张量分片处理的无服务器联邦学习聚合架构,解决了现有方案受限于函数内存限制而无法处理大规模模型的问题,实现了在保持模型精度不变的前提下,支持对任意规模模型进行高效且低成本的聚合。

原作者: Amine Barrak

发布于 2026-04-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Amine Barrak

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

1. 背景:什么是“联邦学习”?

想象一下,有 100 个小朋友(客户端)手里每人都有几张不同的拼图碎片(数据)。他们想拼出一幅巨大的世界地图(训练模型),但出于隐私保护,谁也不能把自己的碎片交给别人看

于是,大家约定:每个人先在自己家里把碎片拼好,然后只把拼好的“进度报告”(梯度/Gradient)发给一个“班长”(服务器)。班长把所有人的进度汇总起来,告诉大家下一步该怎么拼。

2. 遇到的难题:班长的“书桌”太小了

随着拼图越来越精细(模型越来越大,比如从几百兆变成几千兆),“进度报告”变得极其厚重。

现在的云端技术(比如 AWS Lambda)就像是一个**“临时工班长”**。这个班长很省钱,只有在汇总进度时才请过来,干完活立刻走人。但这个班长有个致命弱点:他的书桌(内存)非常小,最多只能放 10 GB 的东西。

  • 以前的方法(λ\lambda-FL 或 LIFL): 班长必须把所有人的进度报告全部摊在书桌上,才能进行汇总。如果报告本身就有 15 GB,班长一看:“哎呀,书桌放不下!” 任务直接失败,拼图被迫停止。这就是所谓的**“内存天花板”**。

3. 本文的创新:GRADSSHARDING(梯度切片法)

作者提出了一个天才的想法:既然书桌放不下整份报告,那我们就把报告“撕碎”!

新方案的操作流程:

  1. 撕碎报告(Sharding): 每个小朋友不再寄送一本厚厚的报告,而是把报告撕成 10 份(分片),每份都很薄。
  2. 分头汇总(Parallel Aggregation): 我们不请一个班长,而是请 10 个临时工班长
    • 1号班长只负责汇总所有人的“第1份碎片”;
    • 2号班长只负责汇总“第2份碎片”……以此类推。
  3. 拼回原样(Reconstruction): 每个班长只用一张很小的书桌,就能轻松搞定自己的那份薄薄的碎片。最后,大家把这 10 份汇总好的薄片重新粘在一起,就得到了一份完美的、完整的总报告。

这个方法的妙处在于: 无论拼图有多大,只要我们请的“临时工班长”足够多,把每份碎片撕得足够薄,书桌永远不会不够用!


4. 实验结果:到底有多厉害?

作者在真实的亚马逊云(AWS)上做了测试,结果非常惊人:

  • 突破极限: 以前的方法遇到超大模型(比如 5 GB 以上)就直接“罢工”了;而 GRADSSHARDING 只要多请几个班长,无论模型多大都能干活
  • 省钱又高效:
    • 当模型达到一定规模(比如 VGG-16 这种级别)时,这种方法比以前的方法便宜了 2.7 倍
    • 因为它不需要请那种“大桌子、高薪水”的班长,只需要请一堆“小桌子、按秒计费”的临时工,效率极高。
  • 速度飞快: 因为 10 个班长可以同时开工(并行计算),汇总速度比一个人慢慢干要快得多。

总结一下

  • 以前的方法: 试图找一个能装下所有东西的大书桌(结果书桌不够大,任务失败)。
  • GRADSSHARDING: 把任务拆成无数个小块,用无数张小书桌同时处理(结果:规模无限大,成本更低,速度更快)。

一句话总结:这篇论文通过“化整为零”的策略,让云端计算能够处理那些原本“装不下”的超大规模人工智能模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →