FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling
本文介绍了 FOCUS,这是一个通过采用耦合松弛缩放(Coupled-Relaxation Scaling)来将可学习的量化缩放与硬件约束解耦,并利用双粒度缩放(Dual-Granularity Scaling)实现更精细的权重自适应,从而提升大语言模型 FP4 精度,且在不增加额外推理开销的情况下达到最先进性能的后训练量化框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图将一座宏大、复杂的知识图书馆装进一个微小的、便携式的背包里。这就是“大语言模型”(LLMs)每天都在进行的挣扎——这些超级聪明的计算机大脑可以写故事、解数学题,并像人类一样聊天。问题在于,这些大脑过于庞大,运行它们需要消耗大量的内存和电力,这使得在日常设备上使用它们既昂贵又缓慢。为了解决这个问题,科学家们使用了一种叫做“量化”(quantization)的技巧。你可以把它想象成将一部高清 4K 电影转换成低分辨率格式,以便让它能在旧手机上播放。目标是在不丢失剧情的前提下缩小数据。最近,一种名为“FP4”的新型超微型格式出现了,它得到了现代计算机芯片的支持,承诺能将这些模型进一步压缩。然而,这里有一个陷阱:将数据压缩到如此之小往往会导致模型“遗忘”某些内容或产生混乱,从而丧失准确性。大问题在于:我们如何在不破坏其智能性的情况下,将模型压缩到这种极小的尺寸?
这篇论文介绍了一种名为 FOCUS 的巧妙新方法来解决这个精确的问题。研究人员意识到,目前缩减这些模型的方式过于僵化。想象一下你在收拾行李箱。标准规则说:“你必须使用完全相同的、预先制好的小盒子来打包你的衣服,并且你以后也必须使用这些同样的小盒子来拆包。”这篇论文认为,这种做法很愚蠢。虽然你确实需要使用小盒子来储存衣服(因为只有这样才装得进行李箱),但你并不需要使用同样的小盒子来最初决定如何折叠衣服。你可以使用一把巨大的、灵活的卷尺来规划打包过程,然后再将结果塞进小盒子里。
FOCUS 通过这种洞察力改进了模型针对微型 FP4 格式的准备工作。它引入了两个主要技巧:
- 耦合松弛缩放(Coupled-Relaxation Scaling, CRS): 这是那把“灵活的卷尺”。在旧的方法中,计算机必须使用一个非常粗略、低精度的尺子来决定如何缩小数字,并且必须使用同样的粗糙尺子来重新组合它们。FOCUS 说:“让我们用一把超级精确、全尺寸的尺子来进行缩放计算,然后再将结果挤压进那个粗糙的盒子里。”这使得计算机能够在不违反微型格式规则的前提下,找到一种更好的方式来打包数据。
- 双粒度缩放(Dual-Granularity Scaling, DGS): 这是关于打包更小物品的。旧方法将一整组 32 个数字视为一个大块,并为所有数字使用同一把尺子。但如果这一组中的某些数字很大而另一些很小呢?FOCUS 将这个大组拆分成更小的子组(就像把一个大披萨切成片一样),并为每一片分配一把定制的尺子。这让计算机能够适应数据的特定细节,而不是强行将其塞入一个一刀切的盒子中。
结果令人印象深刻。当研究人员在几种不同的 AI 模型(如 Qwen 和 LLaMA)上测试 FOCUS 时,它始终优于所有其他方法。例如,在名为 Qwen3-4B 的模型上,当使用 NVFP4 格式时,FOCUS 成功恢复了原始模型 98.2% 的准确性,在使用 MXFP4 时则恢复了 96.2%。与以往经常难以维持在 90% 或 94% 以上的技术相比,这是一个显著的飞跃。
至关重要的是,论文表明 FOCUS 并不会让模型变慢或变得难以使用。尽管计算机在准备模型(即“训练”或“校准”阶段)的过程中会进行额外的计算,但最终的模型运行速度与任何其他 FP4 模型一样快。在单个高端 GPU 上准备一个 Qwen3-4B 模型大约需要 19 分钟,这实际上比一些竞争方法还要快。研究人员强调,这是一种“训练后”(post-training)方法,这意味着他们不需要从头开始重新教导模型;他们只是调整了打包指令。
简而言之,FOCUS 表明,通过放宽对“如何计算”缩放的规则(同时保持最终存储格式的严格性),我们可以将这些巨大的 AI 大脑装进微小的空间,而不丢失它们的聪明才智。这有点像意识到你可以用一张大桌子完美地折叠一件衬衫,即使你最终只能把它存进一个小抽屉里。论文证明了这种方法比旧的、僵化的方式效果更好,为在目前无法处理这些模型的设备上运行强大的 AI 提供了一条路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。