← 最新论文
💬 NLP

AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs

本文介绍了AGoQ,这是一种面向大语言模型的内存高效分布式训练框架,它采用层感知激活量化和保精度8位梯度量化,在保持模型收敛性和准确性的同时,将内存占用降低高达52%,并将训练速度提升1.34倍。

原作者: Wenxiang Lin, Juntao Huang, Luhan Zhang, Laili Li, Xiang Bao, Mengyang Zhang, Bing Wang, Shaohuai Shi

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenxiang Lin, Juntao Huang, Luhan Zhang, Laili Li, Xiang Bao, Mengyang Zhang, Bing Wang, Shaohuai Shi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个庞大且极其聪明的机器人(大型语言模型,LLM)写故事、编写代码和回答问题。为此,你需要一个巨大的记忆库(GPU 显存)来存储机器人在学习过程中的所有“思绪”。问题在于,随着机器人变得越来越聪明,它的“思绪”(激活值)以及它记录的错误笔记(梯度)会变得如此庞大,以至于连最强大的计算机的显存都无法容纳。

本文介绍了一个名为AGoQ(激活与梯度量化)的新系统。你可以将 AGoQ 想象成一种为机器人学习过程服务的巧妙打包与运输服务。它在不损坏机器人“大脑”的前提下,将数据挤压进更小的盒子中,使其能够更快地学习,并在更便宜的硬件上运行。

以下是 AGoQ 的工作原理,使用简单的类比来说明:

1. 问题:一辆杂乱无章的搬家卡车

在训练这些模型时,计算机必须存储两样主要东西:

  • 激活值(Activations): 这是机器人阅读句子时的“当前思绪”。它们占据的空间最大,就像一辆装满巨大蓬松枕头的卡车。
  • 梯度(Gradients): 这是机器人为了修正错误而写下的“修正笔记”。它们非常沉重,需要在多台协同工作的计算机(GPU)之间共享,就像一箱沉重的货物需要在团队中传递。

目前的方法试图缩小这些数据,但如果缩小过度(就像把枕头变成一颗小石子),机器人就会感到困惑,学习效果也会变差。

2. 解决方案:“智能打包”策略(激活量化)

AGoQ 使用了一种称为层感知激活量化的技术。想象一下,你正在用不同类型的物品(易碎的玻璃、沉重的书籍和柔软的衣物)装满一辆搬家卡车。

  • 旧方法: 你试图把所有东西都装进同样大小的盒子里。如果你把玻璃放进小盒子,它会碎掉;如果你把衣服放进大盒子,你会浪费空间。
  • AGoQ 方法: 它会查看每一件物品,并为其决定完美的盒子尺寸。
    • “玻璃”(注意力层): 机器人“大脑”的某些部分非常敏感。AGoQ 意识到,如果将这些“思绪”挤压得太小,会导致错误。因此,它将这些部分保留在原有的大盒子中(高精度)。
    • “衣物”(其他层): 其他部分则更具灵活性。AGoQ 将这些部分压缩成微小的 4 位盒子(就像把衣服折叠进真空压缩袋)。这节省了巨大的空间。
    • “动态调整”: 该系统还注意到,团队中有些计算机有空余空间,而有些则已满。它会调整“打包密度”,让空间较多的计算机承担稍大一点的盒子,从而完美平衡负载。

结果: 机器人的“思绪”所占空间约为原来的四分之一,但机器人依然能完美理解所有内容。

3. 解决方案:“精密运输”策略(梯度量化)

一旦机器人确定了它的错误,它就需要将这些“修正笔记”(梯度)发送给团队中的所有其他计算机,以便大家都能吸取同样的教训。

  • 问题: 以完整细节发送这些笔记既缓慢又会堵塞网络。而以微小的低质量格式发送则往往导致“邮件丢失”或数学错误(溢出),致使机器人学到错误的东西。
  • AGoQ 方法: 它使用8 位梯度
    • 本地累积: 在发送笔记之前,计算机会进行一次快速的“合理性检查”。它暂时将笔记扩展回完整大小以正确求和,然后再将其缩小。这防止了数学运算出错。
    • 智能运输: AGoQ 将过程拆分,而不是试图在运输过程中将笔记相加(这会导致交通堵塞和错误)。它首先将压缩后的笔记发送给所有人,然后每个人在本地进行求和,最后共享最终结果。这就像将包裹发送到本地枢纽, unpack 它,添加你自己的物品,然后重新打包发送最终包裹,而不是试图在卡车以 100 英里/小时的速度行驶时添加物品。

结果: “修正笔记”变得更小,团队可以更快地共享它们,而不会损失精度。

4. “融合”技巧:同时做两件事

通常,压缩数据(量化)和进行数学运算(计算)是两个独立的步骤,这会拖慢速度。AGoQ 将它们合并为一个步骤,就像一位厨师在同一时刻切菜和搅拌锅,而不是切完菜、走到炉边、再搅拌。这使得整个过程变得极快。

结论

通过使用这些巧妙的打包和运输技巧,作者在大型语言模型(如 LLaMA)上测试了 AGoQ,使用了多达 64 台强大的计算机。

  • 显存节省: 他们将所需的显存减少了高达52%。这意味着你可以在相同的硬件上训练更大的模型,或者在更便宜的硬件上训练相同的模型。
  • 速度: 由于数据更小且运输更智能,训练过程比当前最好的系统快了高达1.34 倍
  • 精度: 至关重要的是,机器人没有感到困惑。它的学习效果与庞大的未压缩版本一样好,在标准测试中没有任何性能损失。

简而言之,AGoQ 是一个系统,它教导我们如何通过恰当地折叠大象的腿,将一头巨大的大象塞进一辆紧凑型汽车里,既不伤害大象,也不让汽车行驶变慢。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →