← 最新论文
💬 NLP

Folding Tensor and Sequence Parallelism for Memory-Efficient Transformer Training & Inference

本文提出张量与序列并行(TSP),这是一种新颖的执行策略,它将权重分片和令牌分片折叠到单一设备轴上,以同时降低参数和激活内存开销,为长上下文和内存受限的 Transformer 模型的训练与推理提供了一种硬件高效的替代方案。

原作者: Vasu Shyam, Anna Golubeva, Quentin Anthony

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Vasu Shyam, Anna Golubeva, Quentin Anthony

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正和一群朋友试图拼一幅巨大的拼图,但你们只有一张非常小的桌子(计算机内存)可以工作。拼图太大,以至于没有任何一个人能一次性握住所有碎片。

本文介绍了一种让多台计算机(GPU)协同工作以训练巨型 AI 模型(本质上就是这些巨大的拼图)的新方法。作者将他们的这一新策略称为TSP(张量并行与序列并行)

以下是使用简单类比进行的分解说明:

问题:两种旧的分工方式

为了解决这个拼图难题,团队通常采用两种旧方法之一,但两者都有缺陷:

  1. “权重拆分”法(张量并行):
    想象拼图碎片是游戏的“规则”(模型的权重)。在这种方法中,你把规则书切成两半。A 持有前半部分规则,B 持有后半部分规则。

    • 优点: 你节省了桌面上的空间,因为你没有把整本规则书存储两份。
    • 缺点: 如果拼图包含一个很长的故事(长序列单词),每个人仍然必须握有整个故事才能进行游戏。如果故事巨大,你的手(内存)就会塞满,导致崩溃。
  2. “故事拆分”法(序列并行):
    想象拼图碎片是故事本身。在这种方法中,A 持有故事的前半部分,B 持有故事的后半部分。

    • 优点: 你节省了桌面上的空间,因为你没有一次性握住整个故事。
    • 缺点: 每个人都必须记住整本规则书。如果规则书巨大,你的大脑(内存)就会塞满,导致崩溃。

旧的混合方案: 通常,团队会尝试通过两组不同的朋友来同时做这两件事。一组拆分规则,另一组拆分故事。但这效率低下,因为它用光了所有朋友来拆分工作,导致没有人剩下可以协助其他任务(如数据并行)。

解决方案:“折叠”法(TSP)

作者说:“为什么要用两组分开的人?让我们把工作折叠到单一轴线上。”

TSP中,团队中的每个人同时做两件事

  • 他们持有规则书的一部分(权重)。
  • 他们持有故事的一部分(序列)。

类比:
想象你正在参加一个晚宴。

  • 旧方式: 你有一张桌子,一个人传递菜单(权重),而每个人阅读整本书。另一张桌子上,人们传递书籍(故事),而每个人背诵整份菜单。
  • TSP 方式: 桌上的每个人都拿到一小份菜单一小段故事。

他们如何实现它(魔法技巧)

既然每个人都只有一小份菜单和一小段故事,他们就必须频繁交流以完成拼图。本文描述了两种聪明的方法,使他们在不被压垮的情况下做到这一点:

  1. 针对“故事”部分(注意力机制):
    想象团队需要知道整个故事才能理解特定的句子。与其让所有人同时大喊整个故事,不如让他们轮流进行。一个人向所有人广播他手中的菜单部分。然后,每个人计算他们那部分故事,并快速交换他们的故事碎片(键和值)以重建完整的上下文。这就像接力赛,他们在奔跑时传递接力棒(数据)。

  2. 针对“规则”部分(MLP):
    想象团队需要将不同的规则应用到他们的故事碎片上。与其停下来大喊规则,不如让他们把规则书页围成一圈(环形)传递。A 用第 1 页做数学运算,然后将第 1 页传给 B,同时 B 将第 2 页传给 C。在页面移动的同时,每个人都在忙着做数学运算。这保持了“交通”的流动,同时完成了“工作”。

为什么这更好?

本文声称 TSP 是一种“硬件感知”的解决方案,意味着它是专门为现代计算机芯片相互通信的方式而设计的。

  • 内存节省: 因为每个人都持有部分规则部分故事,每台计算机所需的内存显著下降。这使得团队能够处理更长的故事(更长的上下文),而不会耗尽内存。
  • 速度: 尽管他们来回传递的数据更多(听起来更慢),但他们以与思考重叠的方式进行传递。“传递”发生在他们“思考”的同时,因此总时间不会增加太多。
  • 适应房间容量: 在计算机集群中,最快的连接通常位于同一台机器上的芯片之间(就像坐在同一张桌子旁的人)。较慢的连接位于不同机器之间(不同房间里的人)。
    • 旧方法经常迫使团队分散到不同的房间,从而拖慢速度。
    • TSP 允许整个“拆分”团队容纳在单台机器(一张桌子)上,使他们保持在快车道上。

结果

作者在由 1,024 块强大 GPU(MI300X)组成的巨大集群上测试了这种方法。

  • 内存: 在每次测试中,TSP 使用的内存最少,特别是在故事非常长的时候。
  • 速度: TSP 与旧方法一样快,甚至更快。
  • 可扩展性: 随着团队中计算机数量的增加,TSP 继续表现良好,而旧方法开始因内存限制而挣扎。

简而言之: TSP 是一种更聪明的组织计算机团队的方式。它不再将“规则”和“故事”拆分成独立的组,而是将它们结合起来,使每台计算机都只持有少量两者。这节省了空间,允许更长的故事,并使团队在相同的快速网络上高效工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →