← 最新论文
🔢 mathematics

Accurate Models of NVIDIA Tensor Cores

本文针对 NVIDIA V100、A100、H100 和 B200 等数据中心 GPU 中不兼容 IEEE 754 标准的矩阵乘法单元,提出了能够精确模拟其在 8、16 及 19 位浮点格式下舍入行为、累加器宽度等数值特性的软件模型,以解决跨架构结果不可复现的问题。

原作者: Faizan A. Khattak, Mantas Mikaitis

发布于 2026-04-07
📖 1 分钟阅读🧠 深度阅读

原作者: Faizan A. Khattak, Mantas Mikaitis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一份**“超级计算器内部构造的终极解密指南”**。

为了让你轻松理解,我们可以把 NVIDIA 的 GPU(图形处理器)想象成一个拥有成千上万个“超级速算员”的巨型工厂。这些速算员专门负责做一种叫“矩阵乘法”的数学题,这是训练人工智能(AI)和进行科学计算的核心工作。

1. 核心问题:速算员们“不按常理出牌”

在这个工厂里,有一群特殊的速算员,被称为**"Tensor Cores"(张量核心)**。它们为了追求极致的速度,发明了一套自己的“速算规则”。

  • 传统规则(IEEE 754): 就像学校里的数学考试,要求每一步都必须精确到小数点后几位,哪怕为了精确牺牲一点速度。
  • Tensor Cores 规则: 它们像是“为了赶时间而抄近道”的速算员。为了快,它们在某些步骤上会偷偷“四舍五入”或者“截断”数字,甚至在不同代的速算员(不同型号的 GPU,如 V100, A100, H100, B200)之间,抄近道的方式还都不一样

这就导致了一个大麻烦:
如果你用 A100 显卡算出一道题,再用 H100 显卡算同一道题,结果可能不一样。这对于科学家来说很头疼,因为科学实验要求结果必须能“复现”(即别人用同样的方法也能算出同样的结果)。而且,因为没人知道这些速算员具体是怎么“抄近道”的,大家只能猜,猜错了就会导致 AI 训练失败或科学计算出错。

2. 作者的解决方案:制造“数字双胞胎”

为了解决这个问题,作者(来自英国利兹大学的两位研究者)做了一件非常酷的事情:他们在电脑软件里,为每一代 NVIDIA 的 Tensor Core 造了一个“数字双胞胎”(软件模型)

这个“数字双胞胎”不是普通的计算器,它是一个完美的模仿者

  • 它完全模仿真实硬件的“坏习惯”(比如它知道在什么情况下会截断小数,什么情况下会多保留一位)。
  • 它甚至能模仿不同型号显卡之间微妙的差异。

他们是怎么做到的?(侦探破案法)

  1. 设计“陷阱”测试题: 他们设计了一些特殊的数学题(测试向量),就像给速算员设下的陷阱。比如,故意给一个极小的数字,看速算员是把它当成 0 处理,还是保留下来。
  2. 疯狂试错(随机测试): 他们让软件模型和真实显卡同时做一千万道随机题目。
  3. 找茬与修正: 只要软件模型算出的结果和真实显卡哪怕有一点点不同(比如最后一位数字不一样),他们就立刻停下来,像侦探一样分析:“哦!原来这里多了一个进位位!”或者“原来这里多保留了一位小数!”。
  4. 循环迭代: 他们不断修正软件模型,直到软件模型和真实显卡算出的结果完全一模一样(比特级准确)

3. 这个“数字双胞胎”有什么用?

作者把这个做好的软件模型打包成了一个MATLAB 工具箱,免费提供给全世界使用。它的用处就像给科学家发了一把“万能钥匙”:

  • 提前预演(不用买新显卡): 科学家在写新算法时,不需要真的去买最新的 B200 显卡。他们可以在电脑上用这个模型先跑一遍,看看结果对不对。如果模型显示结果有问题,那真实显卡上肯定也有问题。
  • 解释“为什么结果不一样”: 如果两个实验室用不同显卡算出了不同结果,科学家可以用这个模型来“复盘”,看看是因为哪个显卡的“速算规则”不同导致的。
  • 开发更聪明的算法: 既然知道了速算员会怎么“抄近道”,算法开发者就可以专门设计一些方法来抵消这些误差,从而用低精度的硬件算出高精度的结果(就像用粗糙的尺子量出精确的长度)。

4. 一个生动的比喻:做蛋糕

想象一下,你要做蛋糕(矩阵乘法):

  • 标准做法: 用精密的电子秤称面粉,精确到 0.01 克。
  • Tensor Cores 做法: 为了快,直接用勺子舀面粉。
    • V100 显卡: 勺子有点大,舀多了就抖掉一点。
    • A100 显卡: 勺子形状变了,抖掉的方式不一样。
    • H100 显卡: 甚至有时候勺子会先抖两下再舀。

以前,大家不知道这些勺子的具体形状,做出来的蛋糕味道(计算结果)自然不一样。
这篇论文就是把这些勺子的形状、抖动方式全部画成了图纸(软件模型)。现在,任何烘焙师(科学家)在没买到新勺子之前,就可以拿着图纸在纸上模拟,预测蛋糕的味道,或者设计出一种“补偿抖落”的配方,确保无论用哪个型号的勺子,蛋糕味道都一样好。

总结

这篇论文的核心贡献就是:把 NVIDIA 黑盒子里的“速算黑魔法”变成了透明的、可预测的、可复制的软件模型。 这让科学家和工程师不再需要盲目猜测硬件的行为,能够更安心、更准确地利用这些强大的 AI 加速芯片。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →