GPU Acceleration in Deep Learning Training: A Comparative Study on Model Scale and Performance
这项研究展示了 NVIDIA RTX 3050 GPU 在深度学习训练方面相比 Intel CPU 的显著性能优势,揭示了在 CIFAR-10 数据集上大规模 ResNet50 模型实现了 40.6 倍的加速。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的世界里,计算机被教导去识别模式,从识别照片中的猫到将一个句子从一种语言翻译成另一种语言。这种被称为深度学习的学习过程,依赖于模仿人类大脑神经元连接方式的复杂数学结构。为了训练这些系统,计算机必须进行数十亿次的计算,这项任务需要巨大的处理能力。几十年来,计算机的标准大脑——被称为中央处理器或 CPU——一直是处理通用任务的首选工具。然而,随着这些数字模型变得越来越大、越来越复杂,CPU 往往难以跟上步伐,从而减缓了研究与开发的速度。为了解决这个问题,科学家们转向了一种最初为渲染视频游戏而设计的不同类型的处理器:图形处理器,或称 GPU。如果说 CPU 像是几个能够逐一解决难题的高级专家,那么 GPU 则像是一支由数千名简单工人组成的庞大军队,他们可以同时执行相同的简单任务。这种并行工作的能力使 GPU 特别适合于训练深度学习模型所需的重复性数学运算,但这种优势变得至关重要的确切点一直是详细调查的主题。
湖南师范大学的研究人员致力于测量随着学习模型规模的增加,GPU 相比 CPU 究竟快了多少。他们没有仅仅依赖于理论或计算机模拟;相反,他们使用真实的硬件和真实的数据进行了一系列受控实验。该团队使用了一组标准的 60,000 张小型彩色图像,即被称为 CIFAR-10 的数据集,其中包含飞机、汽车、鸟类和其他常见物体的图片。他们在这些数据上训练了三个不同版本的数字大脑:一个拥有约 50 万个内部参数的极小且简单的网络;一个拥有约 1170 万个参数的中型网络;以及一个拥有约 2560 万个参数的大型复杂网络。对于这三个模型中的每一个,他们都进行了两次完全相同的训练过程:一次在强大的显卡上,一次在高阶中央处理器上,并保持所有其他变量完全一致,以确保公平比较。
结果显示,随着模型的增大,性能出现了明显且剧烈的转变。当研究人员训练最小、最简单的模型时,显卡仅比中央处理器快两倍。在这种情况下,在计算机内存与处理器之间移动数据所花费的时间占据了总时间的很大一部分,限制了并行工作者的速度优势。然而,当模型规模增加到中等水平时,显卡变得快了七倍多。更大规模的计算意味着处理器可以花更多时间进行工作,而减少等待数据的时间。这种差异在最大的模型上变得最为显著。在这里,显卡仅用 134 秒就完成了十轮训练,而中央处理器完成同样的工作则需要超过 5400 秒。这意味着显卡的速度快了 40 倍以上,将原本需要一个半小时以上的训练过程缩短到了仅两分多钟。
至关重要的是,这项研究证实了这种巨大的加速并没有以牺牲质量为代价。在显卡和中央处理器上训练的模型在测试图像上达到了几乎相同的准确率,证明了更快的训练方法并不会产生更差的结果。研究人员发现,模型大小与速度之间的关系并不是一条直线;使用显卡带来的收益呈超线性增长。随着模型内部参数数量的增加,节省的时间变得呈指数级增长。这表明,对于小型、简单的任务,标准的计算机处理器可能就足够了,但对于驱动当今最先进人工智能的大规模模型而言,显卡不仅是一个选项,更是必需品。这项工作为研究人员和工程师提供了一份具体的、定量的路线图,展示了转折点究竟在哪里,以及为什么随着我们构建的数字大脑变得更加复杂,向并行计算的转变变得至关重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。