← 最新论文
🤖 machine learning

Search Your Block Floating Point Scales!

本文介绍了 ScaleSearch,这是一种新颖的策略,它通过对尾数位进行细粒度搜索来优化块浮点数比例因子,从而显著降低量化误差并提升低精度生成模型的性能,其中包括一种实现了近乎零性能损失的专用 ScaleSearchAttention 算法。

原作者: Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《Search Your Block Floating Point Scales!》的解释。

大局观:高效打包行李箱

想象你正在为一次旅行打包行李箱(计算机内存)。你有许多物品(数据)需要塞进去,但行李箱很小。为了让所有东西都装下,你必须把物品压缩(这被称为量化)。

过去,在打包一组物品时,你会查看组内最大的物品,然后说:“好吧,我会压缩其他所有物品,以便让最大的那个刚好能放进去。”这是现代 AI 芯片采用的标准方法。

问题所在:
作者们注意到,仅仅因为最大的物品能装下,并不意味着其余物品都被高效地打包了。有时,基于最大物品压缩所有东西会留下大量空隙,或者把较小的物品压得太扁,导致它们后来难以辨认。这就像试图把一只巨大的泰迪熊和一颗微小的纽扣装进一个盒子里;如果你为了熊而调整盒子的大小,纽扣就会在噪音中丢失。

解决方案:"ScaleSearch"(智能打包员)

这篇论文提出了一种名为ScaleSearch的新策略。该算法不再仅仅查看最大物品并一次性设定规则,而是使用一个微小的“探照灯”,检查几种不同的打包方式。

  • 旧方法: “最大的物品有 10 英寸高。我会将我的比例尺设为 10。”
  • 新方法(ScaleSearch): “最大的物品有 10 英寸。但等等……如果我把比例尺设为 9.5,大物品仍然能装下,但中等大小的物品会清晰得多。如果设为 10.5,小物品看起来会更好。让我快速测试这几个选项,并选出能让整个组看起来最好的那个。”

论文表明,通过这种微小而快速的搜索,计算机可以更精确地打包数据,将“量化误差”(由压缩数据引起的混乱)减少了约27%

特殊硬件:NVFP4

这个技巧之所以有效,是因为新的超快计算机芯片(NVIDIA 的 Blackwell 架构)使用了一种名为NVFP4的格式。

可以把旧的打包方法想象成使用一把只有大刻度(1、2、3)的尺子。而新芯片则拥有一把带有微小、精细刻度(1.0、1.1、1.2 等)的尺子。ScaleSearch就是利用这些微小、精细的刻度来找到完美契合点的技术,而不是仅仅用大刻度去猜测。

“注意力”升级:ScaleSearchAttention

AI 模型(如聊天机器人)必须关注它们已经说过的词,以理解下一个词。这种“记忆”被称为KV 缓存。存储这种记忆占用大量空间并拖慢速度。

作者们创建了一个名为ScaleSearchAttention的特殊版本。

  • 它的作用: 将“智能打包员”的逻辑应用于 AI 的记忆。
  • 结果: 它允许 AI 以非常紧凑的格式(4 位)存储其记忆,同时不丧失理解上下文的能力。
  • 类比: 想象一位图书管理员,通常必须完整详细地写下每本书的标题(缓慢且笨重)。有了这种新方法,图书管理员使用一种巧妙、微小且书写快速的简写代码,但他们会双重检查代码,以确保没有遗漏任何重要细节。

他们证明了什么?(结果)

该论文在真实的 AI 模型(如 Llama 和 Qwen)和视频生成工具(如 Mochi)上测试了这种方法。

  1. 更好的数学与推理: 当他们在数学问题上使用 ScaleSearch 时,AI 变得显著更聪明。对于某个模型,与标准方法相比,其数学测试分数提高了15 分
  2. 更好的语言: 当 AI 写故事或回答问题时,它犯的错误更少。“困惑度”(衡量 AI 困惑程度的指标)下降了,这意味着 AI 听起来更自然、更像人类。
  3. 速度: 最好的一点是?这种“搜索”非常快,几乎不会拖慢计算机。这就像检查三种不同的系鞋带方式;只需一刹那,但能确保你以后不会绊倒。该系统的运行速度达到标准方法的98%

总结

论文指出:“不要仅仅根据最大的一块来猜测如何压缩数据。花一刹那检查几个邻近的选项,你将获得更清晰、更准确的结果,且几乎没有任何速度损失。”

他们称之为ScaleSearch,当应用于 AI 的记忆时,他们称之为ScaleSearchAttention。它使 AI 模型更智能、更高效,而无需新硬件。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →