← 最新论文
💻 computer science

Enabling Memory-efficient Im2win Convolution with Multi-precision Support on GPU CUDA and Tensor Cores

本文提出了一种优化的、内存高效的面向 GPU 的 im2win 卷积框架,该框架利用多精度支持和 Tensor Cores 等专用硬件特性,与 cuDNN 和基于 GEMM 的方法相比,实现了显著更高的性能和更低的内存使用量。

原作者: Xiang Fu, Jixiang Ma, Xinpeng Zhang, Peng Zhao, Shuai Lu, Xu Tony Liu

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiang Fu, Jixiang Ma, Xinpeng Zhang, Peng Zhao, Shuai Lu, Xu Tony Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

深度学习,这一现代图像识别和自动驾驶背后的技术,高度依赖于一种被称为“卷积”的数学运算。你可以将这种运算想象成一个在图像上滑动的窗口,它通过将小的像素块与一组模式进行比对,来识别边缘或纹理等特征。这个过程是人工智能的核心引擎,消耗了运行这些系统所需的大部分时间和能量。为了使这些系统更快、更高效,研究人员多年来一直致力于优化这种滑动窗口在计算机芯片上的移动方式,特别是在高端计算机中常见的强大图形处理器(GPU)上。挑战始终在于一种权衡:快速的方法往往需要大量的临时内存,而节省内存的方法则往往速度较慢或不稳定。

一支研究团队现在开发出了一种执行这些计算的新方法,打破了这种权衡。他们改进了一种称为“im2win”的技术,该技术重新组织了计算机在扫描过程中存储和访问图像数据的方式。通过改变数据的布局,新方法允许计算机以平滑、连续的流式方式移动信息,而不是以零散跳跃的方式。这种简单的组织形式的变化,使得计算机在处理过程中所需的临时内存比旧有的标准方法减少了一半以上。此外,研究人员还调整了这项技术,使其能够适配现代芯片中的两种不同类型的处理能力:处理精确计算的通用核心,以及旨在加速大规模数值块处理的专用“张量核心”(tensor cores)。

研究人员在十二种不同类型的图像处理任务上测试了他们的方法,涵盖了从简单滤波器到高级神经网络中复杂层的各种任务。他们发现,这种优化的方法明显快于目前的行业标准。当在专用的张量核心上运行时,新方法的性能达到了现有最佳软件库的1.4倍,以及一种基于矩阵乘法的常见替代方案的6.4倍。在速度方面(以每秒万亿次运算衡量),该方法比其在通用核心上运行的版本快了近三倍。或许最重要的一点是,这种速度提升是以大幅降低内存占用为代价的。新方法仅需常用矩阵法所需内存的35%,也仅为领先行业软件所用内存的53%。

为了实现这些结果,该团队引入了几项具体的工程改进。他们设计了以“之字形”(zig-zag)模式访问数据,这可以防止计算机内存的不同部分发生拥挤并相互拖慢速度。他们还建立了一个系统,让计算机在计算当前批次数据的同时,预先将下一批数据移动到位,从而有效地隐藏了移动信息所花费的时间。通过仔细测试,他们发现这种“双缓冲”(double buffering)技术是其速度提升中最关键的因素。虽然“之字形”模式有所帮助,但其重要性不及将数据移动与计算重叠的能力。

这项研究证实,通过将软件与计算机内存及处理单元的物理布局进行精细对齐,可以在不牺牲准确性的情况下,使深度学习系统变得更快且更具内存效率。研究人员证明,他们的方法在各种图像尺寸和滤波器形状下都能稳定运行,证明了它是应对现代人工智能多样化需求的稳健解决方案。通过解决内存开销和数据访问效率低下的问题,这项工作提供了一个统一的框架,有望让未来的AI系统能够在现有硬件上运行更复杂的模型,或者让当前的模型以显著更少的能量和时间运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →