← 最新论文
🤖 machine learning

Heterogeneous Parallelism for Multimodal Large Language Model Training

本文提出了一种用于多模态大语言模型训练的异构并行框架,该框架能够在单个计算图中为不同模块启用独立的张量并行布局,从而解决模态特定的扩展不匹配问题,并通过优化的共置执行实现高达 49.3% 的每 GPU TFLOPS 提升。

原作者: Yashaswi Karnati, Kamran Jafari, Akash Mehra, Li Ding, Pranav Prashant Thombre, Ali Roshan Ghias, Shifang Xu, Parth Mannan, Yu Yao, Hao Wu, Eric Harper, Ashwath Aithal, Nima Tajbakhsh

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yashaswi Karnati, Kamran Jafari, Akash Mehra, Li Ding, Pranav Prashant Thombre, Ali Roshan Ghias, Shifang Xu, Parth Mannan, Yu Yao, Hao Wu, Eric Harper, Ashwath Aithal, Nima Tajbakhsh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一个能够看、听、读的超级智能机器人。要做到这一点,你需要结合两种截然不同的“大脑”:

  1. 编码器(Encoder):这部分就像一个专业的相机或麦克风。它非常擅长处理图像或声音,但最适合处理特定且固定大小的数据块。
  2. 大语言模型(LLM):这是庞大的语言大脑。它体积巨大,需要一次性阅读海量文本,并且需要一种截然不同的工作组织方式才能高效运行。

问题:“一刀切”的制服

过去,在训练这些组合机器人时,工程师们强迫这两个大脑穿上完全相同的“制服”(即在多台计算机上分配工作的特定方式)。

这就像一支施工队,其中的水管工电工被迫以完全相同的队形工作。

  • 电工(LLM)需要站成一个巨大的圆圈,以便快速传递电线(这种技术称为张量并行)。
  • 水管工(编码器)只需要以小对的形式工作,因为他们的管道短且固定。

如果你强迫水管工站在电工的巨大圆圈里,他们就会把所有时间都花在等待电工传递电线上。他们并没有在修水管,只是站在那里。这会拖慢整个项目的进度。

解决方案:“异构并行”

这篇论文提出了一种组织施工队的新方法,称为异构并行。它不再强迫所有人穿上同一件制服,而是让每个团队穿上最适合他们的制服,即使他们是在同一栋建筑里工作。

该系统允许“编码器”团队和"LLM"团队:

  1. 以不同的方式拆分工作:LLM 可以使用由大量计算机组成的巨大圆圈,而编码器则使用紧密的配对。
  2. 自主选择座位:它们可以坐在同一台计算机上(共享硬件),也可以坐在完全不同的计算机上,具体取决于哪种方式最能节省空间和时间。

魔法技巧:“翻译器”

让两个团队以不同方式工作的最困难部分,在于它们之间传递信息。如果编码器以“小对”格式完成工作,而 LLM 期望的是“巨大圆圈”格式,数据就会变得混乱。

作者构建了一个特殊的翻译器(称为边界通信器)。

  • 前向传播(交付):当编码器完成工作时,翻译器会立即将数据重塑为 LLM 所需的格式。这就像一名快递员,将一个小包裹重新打包成一个大箱子,然后交给 LLM 团队。
  • 反向传播(返回):当 LLM 从错误中学习时,它会发送反馈。翻译器接收该反馈,将其拆解回编码器理解的小格式,然后返还给它。

这确保了即使两个团队以不同的方式工作,他们也不会丢失数据或学习过程的追踪。

两种坐姿:“共置”与“非共置”

论文测试了这两种团队排列方式:

  1. 共置(共享同一张桌子)

    • 场景:编码器和 LLM 可以容纳在同一组计算机上。
    • 优势:系统不再强迫编码器坐在 LLM 低效的圆圈里,而是让编码器在同一台计算机上坐在自己高效的配对中。
    • 结果:这就像主厨和副厨在同一间厨房里。主厨切菜(编码器),副厨搅拌汤(LLM)。他们互不干扰,厨房的运行速度最高提升了 49%,因为没有人需要空等。
  2. 非共置(分开的房间)

    • 场景:编码器过于庞大(或者 LLM 对内存的需求过高),以至于它们无法共享同一组计算机而不耗尽空间。
    • 优势:系统将编码器移至一个独立的房间(一组独立的计算机)。这释放了 LLM 的房间,使其可以按照自身需求完美布置,而无需编码器占用空间造成杂乱。
    • 结果:这就像将重型机械移至单独的仓库,以便主办公室可以按最高效率进行组织。这使处理单词的总速度最高提升了 13%

证明

作者并非凭空猜测这会奏效,而是进行了测试。

  • 他们证明了“翻译器”不会搞乱数学计算。机器人以与之前完全相同的速度和准确度进行学习,只是更快了。
  • 他们表明,对于小型编码器,共享计算机(共置)是最佳方案。
  • 他们表明,对于巨型编码器,将它们移至单独的房间(非共置)是最佳方案。

总结

这篇论文旨在停止训练人工智能时采用的“一刀切”方法。通过让人工智能系统的不同部分采用最适合其特定任务的高效工作方式,并构建一个智能翻译器在它们之间传递数据,该系统训练速度更快,且消耗的计算机算力更少。这就像终于让水管工和电工按照他们自然的队形工作,而不是强迫他们步调一致地行进。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →