← 最新论文
💻 computer science

FP8 is All You Need (Part 1): Debunking Hardware FP64 as the HPC Holy Grail

本文认为原生 FP64 硬件对于高性能计算已不再不可或缺,并论证了像 NVIDIA B300 这样针对 AI 优化的 GPU,如何通过将 FP8 张量吞吐量与 Ozaki Scheme II 相结合,实现全 FP64 精度和内存受限性能,从而在原生双精度硅片减少的情况下超越前代产品的能力。

原作者: Satoshi Matsuoka

发布于 2026-06-08
📖 2 分钟阅读☕ 轻松阅读

原作者: Satoshi Matsuoka

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“高精度”悬崖

想象一下,超级计算机的世界是一个巨大的高速公路系统,旨在运送重型卡车(科学数据)。几十年来,规则一直是:“为了安全地运送这些重型卡车,你必须使用一座特定的、超强力的桥梁,叫做‘FP64’(双精度)。”

然而,这篇论文指出,新一代计算机芯片(特别是 NVIDIA 的 “Blackwell Ultra” 和 “Rubin” GPU)已经决定不再建造这些强力的桥梁。相反,它们正在建造成千上万条极其快速的微型车道,专门用于 “FP8”(一种用于 AI 的低精度格式)。

  • 旧方式: 芯片拥有一座强力的桥(FP64),可以承载 40 吨的交通量。
  • 新方式 (B300/Rubin): 芯片完全拆除了这座强力的桥。它现在只有一座微小的、摇晃的步道桥(FP64),只能承载 1.3 吨,而庞大的 AI 车道(FP8)则可以承载 5,000 吨。

结果: 如果你尝试在这些新芯片上运行旧的科学软件,交通就会在微小的步道桥上发生拥堵。巨大的 AI 车道会空置并变得毫无用处。论文将此称为 “FP64 悬崖”。

解决方案:“Ozaki 方案”(神奇的翻译官)

论文提出了一个聪明的变通方法。与其试图建造一座新的强力桥梁,不如利用庞大的 AI 车道来 假装 自己是一座强力的桥。

这就是 Ozaki 方案 II 发挥作用的地方。你可以把它想象成一个 大师级翻译官,它使用了一种叫做“中国剩余定理”的数学技巧。

  • 类比: 想象你需要把一段非常长且复杂的秘密信息(高精度数字)通过一条河流发送出去,但目前唯一的船很小,只能携带简短、简单的便条。
  • 技巧: 翻译官不会一次性发送整个信息,而是将信息分解成 10 或 12 个微小的、简单的便条(余数)。
  • 执行: 它使用快速、宽阔的 AI 车道同时发送所有 10 个便条。
  • 重组: 在另一端,一个快速的数学公式(Garner 算法)会将这 10 个便条重新缝合在一起,还原成原始的、完美的、高精度的信息。

因为这些“便条”很简单,所以 AI 车道可以以极高的速度运送它们。论文声称,通过这种方式,你可以在保持旧有强力桥梁精度的同时,获得 AI 车道的速度。

“张量-内存平衡”(新的交通法则)

作者创建了一个名为 张量-内存平衡 (TME) 的新模型来证明其可行性。

  • 旧观点: “如果桥梁很弱,整个系统就会变慢。”
  • 新观点: “如果桥梁很弱,但通往桥梁的道路足够宽,我们只需要让车辆保持移动即可。”

论文表明,对于大多数科学任务(如天气模拟或流体动力学),瓶颈不在于数学计算,而在于 内存带宽(数据加载到芯片的速度)。

  • 好消息: 新芯片拥有 极其巨大 的内存带宽。
  • 问题所在: 旧的数学单元太慢了,无法充分利用这种带宽。
  • 解决方法: Ozaki 方案利用快速的 AI 数学单元,在数据被加载的同时进行处理。这使得系统的运行速度能够匹配内存带宽的速度,而不是受限于那个微弱的桥梁速度。

结果:在不损失精度的前提下提速

论文在新型芯片(B300 和 Rubin)上进行了测试,并将其与上一代芯片(H100 和 B200)进行了对比。

  1. 针对“重型”数学(密集矩阵乘法):

    • 新芯片上的原生 FP64: 极其缓慢(1.3 TFLOPS)。
    • 新芯片上的 Ozaki 方案: 超快(500 TFLOPS)。
    • 结果: 新芯片的速度是其自身原生模式的 380 倍,也是上一代最强芯片速度的 12 倍
  2. 针对“内存密集型”任务(Stencil、SpMV):

    • 这些任务通常受限于数据的读取速度,而非计算速度。
    • 原生 FP64: 受困于那个微弱的桥梁速度。
    • Ozaki 方案: 匹配了庞大的内存带宽速度。
    • 结果: 新芯片的表现与旧的、“平衡型”的芯片一样出色,但提供了更多的原始动力可供其他用途。

“四层结构”安全网

论文认为,为了让这种方法适用于每种类型的科学代码,你需要一座“四层”建筑:

  1. FP8 层: 庞大的 AI 车道(新芯片拥有充足的 FP8 资源)。
  2. INT32 层: 用于特定数学技巧(如 FFT)的备份车道。
  3. FP32 层: 用于简单数学的标准车道。
  4. FP64 层: 旧的强力桥梁。

论文结论: 我们不再需要第 4 层(原生 FP64)了。前三层结合 Ozaki 翻译官,足以支撑起整座大楼。

难点:需要“施工工程”

论文承认这并非魔法;它需要 工程实现

  • 你不能只是插上旧软件就指望它能运行。你必须重写“管道”(内核代码)以使用这个翻译官。
  • 一线生机: 作者认为,由于 AI 编程助手(例如用于编写本论文的工具)非常擅长转换模式,这项“施工工作”可以在 数月 内完成,而不是数年。

总结

论文声称,需要“原生”双精度硅片(FP64)的时代已经结束了。尽管 NVIDIA 的最新芯片已经移除了相关的硬件,但我们可以利用一种数学技巧(Ozaki 方案),将它们庞大的 AI 引擎转化为完美的双精度计算器。

底线是: 你不再需要 FP64 硅片的“圣杯”了。如果你拥有足够的 FP8 能力和正确的软件翻译器,FP8 就是你运行世界上最复杂科学模拟所需要的一切

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →