← 最新论文
💻 computer science

TACO: Efficient Communication Compression of Intermediate Tensors for Scalable Tensor-Parallel LLM Training

TACO 是一个基于鲁棒 FP8 的框架,它采用自适应量化和融合压缩算子,以高效压缩张量并行大语言模型训练中的中间张量,在保持近无损精度的同时实现高达 1.87 倍的吞吐量提升。

原作者: Man Liu, Xingchen Liu, Xingjian Tian, Bing Lu, Shengkay Lyu, Shengquan Yin, Wenjing Huang, Zheng Wei, Hairui Zhao, Guangming Tan, Dingwen Tao

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Man Liu, Xingchen Liu, Xingjian Tian, Bing Lu, Shengkay Lyu, Shengquan Yin, Wenjing Huang, Zheng Wei, Hairui Zhao, Guangming Tan, Dingwen Tao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教导一个庞大的机器人团队(即大型语言模型)去写一个故事。为此,你将工作分配给数百个并行工作的机器人。这被称为张量并行

然而,存在一个主要问题:这些机器人需要不断地互相耳语汇报进度。它们每秒要来回传递数千次便条。问题在于,这些便条非常庞大,而它们用来传递便条的走廊(即网络)又窄又慢。机器人花在等待便条上的时间,比实际写故事的时间还要多。

TACO 是一个新系统,旨在压缩这些便条,让机器人能够更快地交流,同时不丢失故事的含义。

以下是 TACO 的工作原理,通过简单的类比进行解释:

1. 问题:“零”人群

机器人传递的便条(称为中间张量)形状很奇特。其中大多数数字都是极小、极小的数值,紧密聚集在零附近。只有少数数值很大,但它们非常罕见。

  • 旧方法(INT8): 想象一下,你要描述一个人群,其中 99% 的人静止地挤在一个小圈子里,而 1% 的人跑向远方。如果你使用一把标准尺子(INT8),其每一英寸的间距都相等,你就无法准确测量那个小圈子。圈子里的每个人都被挤到了同一个位置,信息因此丢失。机器人会感到困惑,导致训练失败。
  • TACO 的解决方案(FP8): TACO 使用一把特殊的尺子(FP8),它在零附近有非常精细、微小的刻度,而在远处则有更宽的刻度。这非常适合“零人群”。但即使这把尺子也有其局限性。

2. 魔法技巧:“自适应洗牌”(ASH 变换)

即使有了这把特殊的 FP8 尺子,便条在零附近仍然过于拥挤。TACO 执行了一个巧妙的魔法技巧,称为自适应尺度 - 哈达玛变换

  • 类比: 想象一个房间里挤满了人,他们紧紧蜷缩在一个角落里(即零值)。如果你只是让他们排成一队,他们仍然靠得太近,无法准确计数。
  • TACO 的做法: 它首先测量每个小群体的“能量”程度。然后,它轻轻地将安静的群体(低值)推开,使它们更容易被看见,同时将响亮的群体(高值)拉近,以免它们跑出房间边缘。
  • 结果: 人群现在完美地散布在整个房间中,恰好落入 FP8 尺子的“最佳点”。这防止了信息丢失的“零坍缩”现象。

3. 安全网:“双尺度”(DS)

有时,即使经过洗牌,仍有少数数字可能对于 FP8 尺子来说太大或太小。

  • 类比: 想象你在打包行李箱。你有一个用于厚重衣物的主秤,但你还需要一个用于珠宝的微型秤。
  • TACO 的做法: 它同时使用两个尺度。一个尺度调整整个群体以适应行李箱(防止溢出),另一个尺度确保微小的珠宝(小值)不会被压碎。这保持了训练的稳定性,防止机器人“发散”(即偏离正轨)。

4. 速度提升:“融合厨房”

通常,为了压缩这些便条,计算机必须执行三个独立的步骤:测量人群、洗牌,然后打包。这就像一位厨师切菜、搅拌、然后装盘,但每做一步都要走到冰箱前。这很慢。

  • TACO 的创新: TACO 建立了一个“融合厨房”。它将切菜、搅拌和装盘合并为一个单一的、超快的动作。计算机一次性完成所有三个步骤,无需停下来将数据写入内存。这使得过程极其快速,并允许机器人在思考的同时进行交流(将通信与计算重叠)。

结果

该论文在大型模型(如 GPT 和 Qwen)上测试了 TACO,发现:

  • 速度: 在某些情况下,它将训练速度提高了1.87 倍
  • 准确性: 尽管数据被压缩得如此之多,但机器人学到的效果与发送完整、未压缩的便条时一样好。“损失”(误差)几乎不存在。
  • 可扩展性: 即使有 8 个、16 个或更多机器人协同工作,它也能发挥出色效果。

简而言之: TACO 是一种智能、快速的方法,用于压缩 AI 训练机器人之间的海量数据流量。它利用一种特殊的“重排”技巧,使数据完美地适应更小的格式,确保 AI 能够快速学习而不会“迷失心智”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →