← 最新论文
🤖 AI

TetraJet-v2: Accurate NVFP4 Training for Large Language Models with Oscillation Suppression and Outlier Control

TetraJet-v2 是一种面向大语言模型的端到端 4 位全量化训练方法,它在所有线性层中利用 NVFP4 精度,并引入 OsciReset 和 OutControl 以有效抑制权重振荡并控制异常值,从而在相比 FP8 实现显著加速的同时达成近乎无损的性能。

原作者: Yuxiang Chen, Yifan Liu, Xiaoming Xu, Pengle Zhang, Michael Beyer, Martin Rapp, Jun Zhu, Jianfei Chen

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxiang Chen, Yifan Liu, Xiaoming Xu, Pengle Zhang, Michael Beyer, Martin Rapp, Jun Zhu, Jianfei Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向一位巨大而聪慧的学生(一个大语言模型)传授海量信息。通常,为了有效完成这一任务,你需要一间高质量、昂贵的教室,配备完美的照明和巨大的白板(高精度计算)。这需要耗费巨额的电力和硬件成本。

这篇论文介绍了一种名为TetraJet-v2的新方法,它试图在一间微小、低成本的教室中向同一位学生授课,这里只有一块小黑板和昏暗的灯光(4 比特精度)。其目标是使训练过程快 1.67 倍且成本大幅降低,同时确保学生不会学错内容或遗忘刚刚学到的知识。

以下是他们如何解决在如此“低质量”教室中授课时通常出现的问题:

1. 问题:“颤抖的手”(权重振荡)

想象学生正试图在黑板上写下一个数字。在完美的教室里,他们可以精确地写下"0.25"。但在这间低精度教室里,他们只能写下整数或半整数(例如 0 或 0.5)。

如果学生的真实答案恰好位于中间(0.25),他们的手就开始颤抖。一会儿写"0",一会儿写"0.5",然后又回到"0"。他们陷入了循环,来回翻转。在论文中,这被称为权重振荡。它浪费能量,并阻止学生最终确定正确答案。

解决方案:OsciReset(“居中”技巧)
作者发明了一种名为OsciReset的技术。想象一位老师正在观察学生的手。一旦看到学生开始在两个选项之间颤抖,老师就会轻轻握住粉笔,将其直接 snapped 到安全区域(“箱中心”)的中间。

  • 为何有效:它立即停止了颤抖。它并没有冻结学生(这会停止学习);只是为他们提供了一个稳定的起点,以便在新的、更平滑的方向上继续学习。这是首次针对这些巨型模型解决这种特定的“颤抖”问题。

2. 问题:“大声喊叫者”(异常值)

在普通教室里,大多数学生以正常音量说话。但在这些巨型模型中,少数特定的“通道”(将其想象为特定的麦克风)会突然以最大音量尖叫。这些被称为异常值

因为黑板太小(低精度),如果一个麦克风尖叫得太响,老师就必须调低所有其他人的音量,以防止那个尖叫者弄坏黑板。这意味着其他学生安静而重要的低语会被噪音淹没。

解决方案:OutControl("VIP 麦克风”)
作者意识到这些尖叫的麦克风是可预测的;它们总是相同的几个通道。因此,他们创建了一个名为OutControl的系统。

  • 工作原理:他们尽早识别出"VIP 麦克风”(异常值),并给它们配备自己专属的高质量麦克风(将它们保留在更高精度的格式中,如 FP8)。其余学生继续使用小黑板(FP4)。
  • 结果:大声喊叫者不会迫使其他人的音量降低,因此安静的低语依然能被清晰听到。

3. “双块”黑板

为了确保数学运算在这块小黑板上完美运行,他们重新设计了数字的书写方式。他们不是试图将一个巨大的数字塞进一个小方格,而是使用双块系统。

  • 想象一大群学生(一个 128 的块)共享一把大尺子(全局比例尺),但在该组内部,他们被分成更小的 16 人小组,每个小组都有自己的小尺子。这使得他们能够处理非常小和非常大的数字,而不会损失精度。

结果

当他们把所有这些技巧结合起来(居中技巧、VIP 麦克风和双块黑板)时:

  • 速度:他们训练模型的速度比当前标准(FP8)快1.67 倍
  • 准确性:模型的学习效果几乎与在昂贵的高精度教室中训练一样好。他们将廉价方法与昂贵方法之间的性能差距缩小了**50%**以上。
  • 规模:他们在高达 3.7 亿参数的模型上进行了测试,并在超过 2000 亿个单词上进行了训练。

简而言之:TetraJet-v2 是一套新规则,它通过阻止模型颤抖、保护响亮声音并更高效地组织黑板,让我们能够在更便宜、更快速的硬件上训练巨型 AI 模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →