← 最新论文
⚡ electrical engineering

Precision-Aware Variable Bit Processing Elements for Hardware-Efficient Systolic Array Designs

本文提出了一种硬件高效的脉动阵列设计,该设计利用经 NSGA-II 优化的、结合了列截断与压缩器集成的近似浮点乘法器,在保持 FP32、TF32 和 BF16 格式下具有相当的 CNN 准确率的同时,实现了面积、功耗和延迟的大幅降低(分别高达 92%、93% 和 54%)。

原作者: Dantu Nandini Devi, Madhav Rao

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Dantu Nandini Devi, Madhav Rao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代世界中,我们的数字设备正在不断进行着大量的计算,以实现识别照片中的人脸、翻译语言或导航交通。这些任务的核心在于一种被称为乘法(multiplication)的特定数学运算,它对于处理图像和数据中的复杂模式至关重要。几十年来,工程师们一直致力于制造能够以极高精度执行这些乘法运算的计算机芯片,确保数字的每一位都像在纸上计算那样精确。这种方法保证了准确性,但同时也付出了代价:维持这种完美精度所需的电路体积庞大、耗电量高且会产生热量。随着我们对更快、更强大计算的需求不断增长,制造这些更小电路的物理极限正在被触及,这为未来的技术制造了瓶颈。

一种不同的哲学应运而生以解决这个问题,它接受受控的小量误差,以换取巨大的速度和效率提升。这种被称为近似计算(approximate computing)的概念运作于这样一个理念:对于许多现实世界的任务,例如识别照片中的一只猫或压缩视频文件,人类的眼睛和大脑无法察觉由微小不精确数学带来的细微差异。如果计算机可以跳过计算中最困难的部分,它就能在完成任务时速度更快,同时消耗更少的能量。研究人员面临的挑战在于,弄清楚究竟可以在不破坏最终结果的前提下牺牲多少精度——这是一个需要通过在广阔的设计选择空间中进行权衡来完成的平衡过程。

一个研究团队通过设计一种专门针对这些容错任务的新型硬件加速器,应对了这一挑战。他们专注于一种被称为脉动阵列(systolic array)的结构,这本质上是一个由微小处理单元组成的网格,数据像波浪一样在其中相互传递,从而高效地进行矩阵乘法。研究人员意识到,这个网格中最耗能的部分是每个单元内部的乘法器。他们并没有将每个乘法器都建成完美的,而是开发了一种方法来创建“不完美”的乘法器,使其具有策略性的缺陷。通过有意识地在计算过程中舍弃数字中不重要的位,并使用特殊的电路引入微小的、相互抵消的误差,他们创造了一个系统,使错误能够相互抵消。这使得硬件在保持极高效率的同时,仍能产生足够用于实际应用的准确结果。

为了找到速度与精度之间的完美平衡,研究人员并没有依赖直觉。他们采用了一种模仿自然进化过程的强大搜索算法,来探索数百万种可能的配置设计。想象一个包含每一种可能的构建这些不完美乘法器方式的庞大图书馆;该算法系统地测试各种组合,保留那些能提供最佳权衡的设计,并丢弃那些过于不准确或效率不够高的设计。他们在三种处理数字的标准格式(从用于科学计算的高精度格式到专为人工智能设计的更紧凑格式)上测试了这些设计。目标是观察他们是否可以根据手头任务的具体需求来定制不完美的程度。

探索的结果令人瞩目。当研究人员将优化的、不完美的设计应用于图像处理任务(如平滑照片中的噪声或压缩图像进行存储)时,硬件变得明显更小且更快。在某些情况下,与传统的、完全精确的版本相比,新设计将芯片的物理尺寸缩小了高达92%,并将功耗降低了多达93%。值得注意的是,这些巨大的节省并没有以牺牲视觉质量为代价;由近似硬件生成的图像与由精确硬件生成的图像几乎无法区分,保持了极高的视觉保真度。

当应用于用于模式识别的人工智能模型时,研究结果甚至更加引人注目。研究人员在包含成千上万张手写数字、衣物和日常物品图像的标准数据集上测试了他们的设计。在若干实例中,使用近似乘法器实际上提高了人工智能的性能。例如,一个训练用于识别衣物的模型,在使用不完美硬件时的准确率竟然高于使用完美硬件时的准确率。这一反直觉的结果表明,近似计算引入的微量噪声可能有助于计算机更好地进行泛化,类似于人类大脑可能会忽略微小细节以更快识别出一张脸。对于测试的最复杂数据集,表现最好的近似设计提供了高达92%的尺寸节省和93%的功率节省,同时仍能提供与精确方法相当或更好的分类准确度。

这项工作证明,通往更高效计算的路径并不总是需要制造更好、更精密的工具。相反,可以通过理解在哪里精度是真正必要的,以及在哪里可以安全地放宽要求。通过使用一种智能搜索过程来设计“足够好”而非完美的硬件,研究人员展示了构建比以往更小、更快且更节能的计算机芯片是可能的。这些设计现在已提供给其他工程师使用,为构建能够处理日益增长的人工智能需求且不会过度消耗能源的下一代设备提供了一种新途径。该研究证实,在计算领域,有时一点点误差正是让系统运行得更好的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →