← 最新论文
🤖 machine learning

FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

FORGE 是一种内存高效的 LLM 训练方法,它通过将优化器步骤融合进反向传播过程,通过完全在寄存器中处理梯度来消除已物化的梯度,从而使优化器内存占用减半、加速训练,并在不改变底层更新逻辑的情况下保持全精度保真度。

原作者: Dikshant Kukreja, Kritarth Prasad, Avinash Anand, Zhengkui Wang, Erik Cambria, Timothy Liu, Aik Beng Ng, Simon See, Bapi Chatterjee

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Dikshant Kukreja, Kritarth Prasad, Avinash Anand, Zhengkui Wang, Erik Cambria, Timothy Liu, Aik Beng Ng, Simon See, Bapi Chatterjee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于 FORGE 论文的解释,已将其转化为简单易懂的日常语言,并使用了类比。

核心问题: “杂乱的工作坊”

想象一下,你正在一台计算机上训练一个巨大的 AI 模型(比如一个机器人大脑)。为了教导这个机器人,计算机必须进行大量的数学运算。

在标准的做法中(称为“反向模式微分”),计算机遵循一个严格的两步过程:

  1. 计算错误: 它观察数据,找出机器人出错的地方,并为机器人大脑的每一个部分写下一份巨大的“纠错笔记”(梯度)。它把这些笔记写在一块巨大的白板上(计算机的内存)。
  2. 应用修正: 只有在整个白板被填满之后,计算机才会拿起橡皮擦和记号笔,根据这些笔记真正去更新机器人的大脑。

瓶颈所在: 问题在于,计算机在持有机器人大脑和下一步所需的笔记的同时,还必须持有那块巨大的笔记白板。这个“白板”占用的空间非常大,以至于在训练开始之前,往往就会填满计算机的内存。这就像是在车库里修车,但你必须同时把汽车的完整蓝图、工具和维修手册全部铺在地上。如果车库太小,你就装不下这辆车。

解决方案:FORGE(“即时修复”法)

本文的作者提出了 FORGE(融合寄存器梯度消除法),他们问道:“为什么非要把笔记写在白板上呢?”

他们认为,那份巨大的笔记列表只是我们进行数学运算的一种“产物”,而不是学习过程本身真正需要的东西。

FORGE 的工作原理:
与其把笔记写下来然后再读出来,FOR切是在计算机最快、最小的存储区域(称为“寄存器”)中,同时进行数学计算和修正工作。

  • 类比: 想象一位大厨正在烹饪一道复杂的菜肴。
    • 旧方法: 大厨切好一个洋葱,在笔记本上写下“切好的洋葱”,然后把洋葱放进碗里,接着处理下一种食材。等所有食材都切好并列好清单后,大厨再阅读笔记本,把它们全部混合在一起。笔记本占用了计数台的空间。
    • FORGE 方法: 大厨切好一个洋葱,立即把它丢进锅里。然后切好一个胡萝卜,也立即丢进去。他们从不写任何东西,也不需要笔记本,计数台始终保持整洁。

为什么这很重要

论文声称这种“无笔记”方法带来了三大好处:

1. 大幅节省空间(内存)
因为计算机不再将巨大的笔记列表写入主内存,它释放了大量的空间。

  • 结果: 在标准的计算机芯片(H200)上,他们能够使用减少 53% 内存的情况下,训练一个拥有 80 亿参数的模型。
  • 类比: 这就像是因为你不再需要在走廊里堆放额外的椅子,所以能把一张 10 人餐桌放进单身公寓里。

2. 速度更快
因为计算机不需要停下来写笔记、等待,然后再读回笔记,整个过程变得更快了。

  • 结果: 训练步骤的速度提升了约 1.5 倍
  • 类比: 这就像是快递员送完一个包裹后,跑回卡车取下一个,如此循环(旧方法);而 FORGE 则是通过一条传送带,在抓取包裹的同时直接将其装上卡车(FORGE)。

3. 不损失准确性
通常,当你试图通过跳过步骤来节省空间时,你会损失精度(机器人学得没那么好)。作者证明了,由于他们在丢弃数据之前,是在计算机最高质量的“寄存器”(全精度)中进行数学运算,因此这种学习在数学上与旧的、缓慢的方法是完全等价的

  • 结果: 机器人学得一样好,但效率更高。

“分块(Tile)”技巧

他们是如何在不造成混乱的情况下完成这一切的?他们将巨大的数学问题分解成小的、可管理的块,称为**“分块(Tiles)”**(例如 128x128 的方块)。

  • 他们处理一个分块:计算误差,修正大脑,然后立即丢弃误差。
  • 然后移动到下一个分块。
  • 因为他们是逐个分块进行的,计算机永远不需要同时持有整份误差清单。

这让我们能够做什么

论文表明,通过 FORGE:

  • 你可以在同样的计算机上训练更大的模型。
  • 你可以使用更大的“批次”(一次教给机器人更多例子)而不会耗尽内存。
  • 在一项特定的测试中,他们能够用 4 块 GPU 训练出一个如果使用旧方法则需要 8 块 GPU 才能驱动的模型。

总结

FORGE 是一种全新的 AI 训练方式,它阻止了计算机用临时的“纠错笔记”来堆满其内存。通过在芯片最快的部位即时计算错误并修正模型,它将内存占用量减半,并加速了训练,且完全不会降低 AI 的智能水平。它将一个拥挤、缓慢的工作坊变成了一条流线型、高效率的自动化生产线。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →