← 最新论文
🤖 machine learning

Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention

本文介绍了 Full-Stack FP4,这是一个模块化框架,它将 NVFP4 量化从线性投影扩展到了包括稳定的优化器状态、Root/Muon 计算以及混合精度注意力机制在内的领域,在单张 RTX 5090 上实现了接近 BF16 的预训练性能,并获得了显著的显存节省与加速收益。

原作者: Siyu Ding, Mingchuan Ma, Jiabo Tong, Xingrun Xing, Ziming Wang, Guoqi Li

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Siyu Ding, Mingchuan Ma, Jiabo Tong, Xingrun Xing, Ziming Wang, Guoqi Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个巨大的数字大脑如何说话、写作和思考。这个“大脑”是一个大语言模型(LLM),为了学习,它必须处理如山一般的海量信息。但问题在于:它学得越多,对计算机内存和电力的渴求就越强烈。这就像试图在一台破旧的小型笔记本电脑上运行一部超高清的大片;屏幕变得模糊,风扇发出尖叫。为了解决这个问题,科学家们一直尝试缩小计算机进行数学运算时使用的数字。他们不再使用极其精确、沉重的数字(就像一张细节丰富的照片),而是转向使用更小、更轻的数字(就像一张像素化的素描)。这被称为“低精度训练”。最近,一种名为“FP4”(4位浮点数)的新型微小数字出现了,它承诺让这些巨大的大脑变得更小、更快。但问题在于:虽然大脑的主体部分可以处理这些微小的数字,但那些“辅助”部分——比如它用来记忆学习内容的内存,以及它用来理解句子的复杂数学运算——在被迫使用如此小的数字时,会不断崩溃或变得混乱。这就像拥有一台赛车引擎,却试图用自行车链条来驱动它;引擎已经准备好了,但机器的其他部分却跟不上。

这篇论文介绍了一个名为 Full-Stack FP4 的巧妙新工具包,它充当了这些数字大脑的“首席机械师”。研究人员意识到,你不能对大脑的每一个部分都使用同样的微小数字规则。有些部分,比如主要连接部分,可以很好地处理微小数字。但其他部分,比如计算机用来记住昨天学到了什么的“记忆”,是非常敏感的,需要特殊的照顾。该团队创建了一个模块化系统,通过为大脑的不同部分使用不同的“配方”来进行运作。对于主要连接部分,他们使用了一种名为 LoRA-SVD 的技巧,这就像是在使用像素化方块的同时,保留最重要细节的高分辨率素描。对于记忆部分,他们发明了一种在将数字挤压进微小盒子之前将其“平滑化”的方法,以免信息丢失。对于帮助大脑专注于正确词汇的数学运算(注意力机制),他们决定将最敏感的部分保持在高清晰度,而让其余部分保持像素化状态。

当他们在 30 亿参数的模型(一个中等规模的数字大脑)上使用 640 亿个单词的训练数据进行测试时,结果令人印象深刻。“Full-Stack FP4”大脑的学习效果几乎与传统的、重型版本完全一致。它们之间的学习得分差异仅为微小的 0.838%,几乎察觉不到。事实上,当他们测试该微小数字版本在回答从未见过的问题时的表现时,尽管它使用的内存要少得多,但它预测正确词汇的能力甚至反而略好一些。在单块强大的显卡(RTX 5090)上,这种新方法使大脑在某些任务中的学习过程快了 2.5 到 2.8 倍,并且比标准高精度方法节省了 38% 到 42% 的内存

研究人员谨慎地指出,虽然这种方法在 30 亿参数以内的模型上表现出色,但他们尚未证明它是否适用于规模更大的大脑或更长时间的训练。他们还发现,你不能把微小数字一股脑地套用到所有地方;如果你试图在没有这些特殊配方的情况下,强迫大脑最敏感的部分使用最小的数字,学习过程就会崩溃。但就目前而言,“Full-Stack”方法表明,我们可以通过针对大脑不同部分提供其真正所需的特定精度水平,而不是强行采用“一刀切”的方案,来构建更聪明、更快且更便宜的人工智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →