← 最新论文
💻 computer science

BF16 Component-Product Emulation of FP32 and FP64 GEMM on Intel AMX

本文提出了一种面向 CPU 的算法,该算法利用 Intel AMX BF16 矩阵乘法来模拟高精度的 FP32 和 FP64 GEMM 操作,通过将操作数分解为多个低精度分量并在更高精度中进行累加,实现了具有竞争力的吞吐量和可调的精度。

原作者: Bing Cui, Yu Liu

发布于 2026-09-07✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Bing Cui, Yu Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代计算机的内部架构正呈现出一种日益增长的分裂。一方面,是专门为人工智能设计的强大引擎,它们擅长极速执行数十亿次简单的计算。这些引擎在处理短小且简单的数字时表现最佳,通过牺牲极小部分的细节来换取巨大的速度。另一方面,科学发现的世界——模拟天气模式、模拟原子如何结合或预测流体流动——仍然依赖于长而精确的数字。这些科学计算需要每一分细节来保持稳定性和准确性,但处理它们的标准计算机部件通常比新型 AI 引擎更慢,效率也更低。这产生了一个困境:科学家们既需要新硬件的速度,又无法承受失去其工作所需的精度。

来自中国迈格芬(Maginfra Co., Ltd.)的研究人员探索了一种利用特定类型的计算机芯片(即 Intel AMX)来弥合这一差距的方法。他们的目标是观察能否“欺骗”那些快速、低精度的 AI 引擎,使其执行科学领域所需的缓慢、高精度的数学运算。研究人员并没有直接要求芯片进行复杂的数学运算,而是将问题分解成更小、更简单的部分。想象一下,尝试用一把只标有整英寸刻度的尺子去测量一段很长的距离。你可以先测量整英寸的部分,然后测量剩余的分数,接着测量剩下的微小碎片,最后将它们全部相加,从而得到一个精确的总量。研究人员将这种逻辑应用到了数字上。他们将一个复杂的数字拆分为几个简单的部分,以便快速的 AI 引擎能够轻松处理。然后,他们对这些部分进行了多次快速计算,并仔细地将结果重新组合起来,以重建最终的高精度答案。

该团队在两个不同的精度水平上测试了这种方法。首先,他们处理了单精度数学运算,这是许多科学应用的标准。他们发现,通过将每个数字拆分为三个部分并运行六次特定的计算,他们可以获得与现有最佳软件同样准确的结果,但速度显著提升。在他们测试的计算机芯片上,这种方法比标准的数学运算方式快了 1.14 到 2.56 倍。这种加速在处理大规模数据集时最为明显,因为在这种情况下,拆分和重组数字所带来的额外开销相对于计算本身的巨大速度而言变得微不足道。

当他们转向双精度数学运算——这种运算更加精确,用于最严苛的科学模拟时——挑战也随之增加。在这里,研究人员必须将每个数字拆分为六个部分。由于计算过程需要极其谨慎地进行重组,整个过程变得更加复杂。他们测试了该方法的不同版本,保留的计算小块数量从六个到二十一个不等。他们发现了一个明显的权衡:保留的碎片越多,答案就越精确,但也会使过程变慢。仅使用六个碎片时,该方法对于超大型问题而言足够快,能够比标准软件快达 1.7 倍。然而,随着他们通过增加碎片数量来提高精度,管理这些碎片的额外工作量逐渐抵消了速度优势。最终,当试图保留二十一个碎片时,尽管它更精确,但该方法反而比标准方法更慢。

这项研究还强调,这种技术并非适用于所有情况的万能方案。它在计算的数字保持在特定范围内时效果最好,类似于一把长度有限的尺子在没有特殊调整的情况下,无法测量过长或过短的距离。研究人员指出,他们的方法并不适用于每一种可能的数字类型,特别是那些极大或极小的数字,并且它不能保证与现有软件实现位对位的完美匹配。相反,它为那些需要在其数据符合该方法限制的前提下,同时追求高速度和高精度的科学家提供了一种新的工具。通过展示低精度硬件也可以用来解决高精度问题,这项工作预示着一个未来:即为人工智能而构建的专用引擎,也可以为科学发现的繁重任务提供加速。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →