← 最新论文
🤖 machine learning

Model Parallelism With Subnetwork Data Parallelism

本文介绍了子网络数据并行(Subnetwork Data Parallelism, SDP),这是一种分布式训练框架,它将模型划分为结构化的子网络并在各工作节点间进行训练,且无需交换激活值,在多种架构和规模下实现了显著的内存减少(28%-60%),同时保持或提升了性能。

原作者: Vaibhav Singh, Zafir Khalid, Pietro Cagnasso, Edouard Oyallon, Eugene Belilovsky

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Vaibhav Singh, Zafir Khalid, Pietro Cagnasso, Edouard Oyallon, Eugene Belilovsky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个庞大、聪明但极其饥渴的机器人(一个大型 AI 模型)如何说话或识别图像。问题在于,这个机器人需要一个既大又昂贵的厨房,只有极少数人能负担得起建造这样一个厨房。在 AI 的世界里,这个“厨房”就是强大图形卡(GPU)上的计算机内存(RAM)。

这篇论文介绍了一种训练这些巨型机器人的新方法,称为子网络数据并行(Subnetwork Data Parallelism, SDP)。下面通过简单的类比来解释它的工作原理。

旧方法:“全量副本”问题

传统上,为了训练一个大型 AI,研究人员使用一种叫做**数据并行(Data Parallelism, DDP)**的方法。

  • 类比: 想象你有一支由 8 名厨师(GPU)组成的团队,正在尝试烹饪一场盛大的宴会。在旧方法中,每一位厨师都会得到一份完整的、全套的食谱以及所有的食材。他们都烹饪整道菜肴,品尝,然后向彼此大声喊出他们的笔记,以达成共识,从而改进下一轮的食谱。
  • 问题: 这是极其浪费的。每位厨师都需要一个巨大的厨房,才能容纳他们自己那份食谱和食材的副本。如果食谱太大,厨房就会“爆炸”(内存耗尽),导致厨师们根本无法烹饪。

新方法:“专业化团队”(SDP)

作者提出了子网络数据并行(SDP)。与其给每位厨师整本食谱,不如将食谱拆分为特定的章节,并将不同的章节分配给不同的厨师。

  • 类比: 现在,厨师 A 只负责开胃菜,厨师 B 负责汤品,而厨师 C 负责主菜。
    • 无需共享整道菜: 至关重要的一点是,他们不需要把整道菜在彼此之间来回传递。他们只讨论自己正在处理的特定食材。
    • 厨房缩小了: 因为厨师 A 只需要持有开胃菜的食谱,所以他们的厨房可以小得多。这使得你可以将一场盛大的宴会装进一个更小、更便宜的厨房里。
    • 结果: 你可以训练一个更大的机器人(或者训练得更快),而不需要一个超级昂贵的厨房。

两种拆分工作的方式

论文测试了两种将这些“子食谱”分配给厨师的不同方式:

  1. 前向掩码(“切分食材”法):

    • 工作原理: 厨师在开始烹饪之前,就直接扔掉了他们不应该使用的食材。他们只烹饪被分配到的那部分菜肴。
    • 优势: 这最节省空间,因为他们甚至不需要存储那些未使用的食材。这就像是做汤时,只购买你需要的胡萝卜和洋葱,完全忽略购物清单上的其他内容。
    • 代价: 由于他们忽略了部分食谱,他们必须多做几次批次,以确保学到完整的全貌。
  2. 后向掩码(“读完整本书,只写你的笔记”法):

    • 工作原理: 厨师阅读了整本食谱(完整模型)以理解上下文,但在记录如何改进菜肴的笔记时,他们只写下自己负责的部分。
    • 优势: 这种方式在数学上更“诚实”,因为厨师仍然理解整道菜肴,但他们只在记录笔记时节省空间。这是一种更安全、更稳定的学习方式。

他们发现了什么?

研究人员在两种截然不同的 AI 类型上测试了这些方法:

  1. 语言模型(LLMs): 比如会写文章的“LLaMA”模型。他们尝试训练具有 5 亿和 10 亿个“神经元”(参数)的模型。

    • 结果: 他们减少了 28% 到 60% 的内存需求。在某些情况下,他们可以将原本需要巨大厨房的模型放入更小的厨房中,且不会损失 AI 的语言表达能力。
    • 加成: 他们发现 SDP 可以完美地与其他的内存节省技巧(如“激活检查点”和“FSDP”)结合使用。这就像堆叠乐高积木;你可以将 SDP 与其他方法结合,将内存占用率大幅降低至 85%
  2. 图像分类器: 识别图片的模型(如 ResNet 和 Swin Transformers)。

    • 结果: 他们在标准图像数据集(CIFAR)上训练了这些模型。即使在内存显著减少(有时低至原始容量的 40%)的情况下,该 AI 识别图片的能力仍与全尺寸版本一样出色。在某些情况下,“专业化团队”的方法实际上帮助了 AI 更好地学习,起到了一种“正则化”(一种防止过度思考的方法)的作用。

核心结论

这篇论文并不声称发明了某种新型 AI,也不声称发明了某种用于医院或自动驾驶汽车的新型 AI 用法。相反,它解决的是一个物流组织问题

把它想象成一种新的建筑施工队组织方式。与其给每个工人一套完整的摩天大楼蓝图(这会占用太多的口袋空间),不如只给每个工人负责的那一层楼的蓝图。他们依然在建造同一栋摩天大楼,但他们需要的口袋空间更小,并且可以用同样的资源建造更高的建筑。

关键要点:

  • SDP 将一个大型 AI 模型拆分为较小的部分,分布在不同的计算机上。
  • 它消除了每台计算机都需要持有整个模型的必要性,从而节省了 28%–60% 的内存。
  • 它能与现有的 AI 模型(如 LLaMA 和 ResNet)兼容,无需改变其使用方式。
  • 它可以与其他内存节省技巧结合使用,以节省更多空间(高达 85%)。
  • 尽管使用了更少的内存,但 AI 的表现与传统方法一样好(甚至更好)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →