← 最新论文
🤖 machine learning

Normalized Architectures are Natively 4-Bit

本文证明,nGPT 通过将权重和隐藏状态约束在单位超球面上,能够通过建设性信号累积自然地增强信噪比,从而实现稳定高效的端到端 4 比特训练,进而消除了对复杂精度保持干预措施的需求。

原作者: Maxim Fishman, Brian Chmiel, Ron Banner, Daniel Soudry, Boris Ginsburg

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Maxim Fishman, Brian Chmiel, Ron Banner, Daniel Soudry, Boris Ginsburg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《归一化架构原生支持 4 比特》的解释。

核心难题:用低精度破解密码

想象你正在建造一座巨大且极其复杂的乐高城堡(大型语言模型)。通常,你会使用巨大而坚固的砖块(高精度数学运算)来确保城堡高耸挺立,不会崩塌。

然而,为了让城堡建造得更快、存储成本更低,工程师们希望使用微小而脆弱的 4 比特乐高砖块。问题在于,如果用这些微小砖块配合标准设计,城堡往往会倒塌或变得摇晃不稳。为了解决这个问题,建造者通常不得不添加昂贵的脚手架、额外的粘合剂以及复杂的测量工具(例如“随机哈达玛变换”和“每张量缩放”),仅仅为了维持结构不垮掉。这些修复措施会拖慢一切进程。

解决方案:新蓝图(nGPT)

这篇论文介绍了一种名为nGPT的新蓝图。作者没有试图用额外的粘合剂去修补脆弱的 4 比特砖块,而是改变了砖块本身的形状。

在 nGPT 中,模型的每一部分都被强制约束在“单位超球面”上。

  • 类比:想象一块标准的乐高砖块可以是任何尺寸,从微小的鹅卵石到巨大的巨石。如果它们都很小,这就很难将它们整齐地堆叠起来。
  • nGPT 的转折:在 nGPT 中,每一块砖都被强制为完全相同的大小和形状,就像一颗完美的弹珠。它们都被约束在无形球体的表面上。

论文声称,由于这种形状约束,模型具有原生鲁棒性。它可以完全由微小的 4 比特砖块构建而成,而无需任何额外的脚手架或粘合剂。它直接就能运行。

为什么有效?“合唱”效应

研究人员问道:为什么这种球体形状能让模型如此强大?

他们观察了模型如何进行数学运算。模型通过取数千个数字,将它们相乘,然后全部相加(即“点积”)来完成运算。

  1. 标准方式(GPT):想象一个由 4000 名歌手组成的合唱团。在标准模型中,歌手们以不同的音量唱着不同的音符。当你把它们加起来时,噪音(由微小 4 比特砖块产生的错误)会相互抵消,但实际的歌曲(信号)却在混乱中丢失了。信号很微弱。
  2. nGPT 方式:因为所有歌手(数字)都被强制为相同的大小(位于球面上),它们自然地开始以某种协调的方式歌唱。它们并非完全同步,但具有微弱的正相关性
    • 类比:这就像体育场里的人群在做“人浪”。即使波浪很小,但因为每个人都在大致相同的方向移动,波浪就会汇聚成巨大而有力的运动。
    • 结果:在 nGPT 中,“信号”(预期的数学运算)像协调的波浪一样建设性地增强。而“噪音”(微小砖块带来的误差)仍然像随机的闲聊一样自我抵消。

这创造了一个更清晰的信号。论文称这为更高的信噪比(SNR)

“平坦地形”的益处

由于信号如此强大且清晰,模型变得非常稳定。

  • 类比:想象在山上行走。
    • 标准模型:就像在崎岖不平的悬崖上行走。如果你稍微走错一步(学习率不佳或微小的数学错误),你可能会从悬崖边缘跌落。你必须非常小心。
    • nGPT 模型:就像在宽阔平坦的高原上行走。你可以迈大步或小步,都不会跌落。你可以朝任何方向行走,而无需担心撞毁。

这意味着工程师不必花费数小时去微调“学习率”(模型学习的速度)。那些适用于巨大、沉重砖块的设置,也完美适用于微小的 4 比特砖块。

他们的测试内容

作者不仅谈论理论,还构建并测试了这些模型:

  • 小规模:他们测试了一个拥有 12 亿参数的模型。
  • 大规模:他们测试了高达 300 亿参数的巨型“混合专家”(Mixture of Experts)模型。
  • 结果:在每种情况下,nGPT 模型都仅使用 4 比特数学运算成功进行了训练。它们不需要标准模型所需的那些额外“粘合剂”(RHT 或缩放)。事实上,nGPT 模型往往更准确、更快,因为它们无需进行额外的运算来修复数学错误。

总结

这篇论文认为,我们不应仅仅试图用复杂的补丁来修复低精度数学。相反,我们应该将架构本身设计为“量化就绪”。通过将模型强制约束为球体形状,数学运算自然地变得足够鲁棒,能够处理微小的 4 比特砖块,从而使 AI 更快、更便宜、更易于训练,且不会损失质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →