The Hidden Energy Cost of Scaling AI Hardware: A Comparative Analysis of Manufacturing and Operational Energy
本文揭示了制造人工智能硬件(尤其是高带宽内存)所蕴含的快速增长的内含能是一个关键且常被忽视的环境成本,其规模很快将超过运营能耗,因此有必要建立一个更广泛的硬件可持续性评估框架。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能的世界就像一场大规模的高速火车竞赛。多年来,所有人都在痴迷于火车在运行时跑得有多快——引擎的速度、燃料的效率,以及每消耗一加仑电力能运载多少乘客(数据)。这就是科学家们所说的“运行能耗”(operational energy)。它是当你按下开关、计算机开始工作时你所支付的那部分电量。但在这段旅程中,有一个经常被忽视的隐藏部分:建造这列火车本身的成本。在第一位乘客登车之前,必须先开采、熔炼并组装数千吨的钢铁、玻璃和铜。在计算机芯片的世界里,这就是“制造能耗”(manufacturing energy)。它是指在硅片上刻蚀微小电路以及堆叠承载 AI 大脑的存储层时所消耗的电力。问题不仅在于 AI 在思考时使用了多少能量,还在于构建这个“思考者”本身耗费了多少能量。
这篇由研究员 Emre Salman 和 Abrar Abdurrob 撰写的论文,决定从全局视角出发,而不只是关注运行成本。他们将目光聚焦在驱动当今最智能 AI 模型的特定硬件上:数据中心加速器。这些是用于训练巨型语言模型的超级芯片。作者们发现了一个令人惊讶的不平衡现象。虽然我们在提高这些芯片运行效率(即每项任务消耗更少的电力)方面已经做得非常出色,但制造它们的成本却在飙升。主要罪魁祸首是什么?是一种被称为高带宽内存(HBM)的特殊超高速内存。可以将 HBM 想象成一个巨大的图书馆,书架就堆叠在脑部旁边,以便大脑可以瞬间获取信息。为了跟上 AI 对数据的渴求,制造商正将数十层这样的内存堆叠在一起。论文发现,这种堆叠过程极其耗能,以至于在芯片通电运行之前,它就已经占据了制造该芯片总能耗的一半以上。
研究人员对比了这些芯片的“出生成本”(制造)与“生命成本”(运行)。他们发现,如今制造单个 AI 加速器的能量大约为 146 千瓦时(kWh)。然而,它在运行三年的过程中所消耗的能量要高得多,范围在约 6.4 到 12.8 兆瓦时(MWh)之间——那是制造成本的数千倍。因此,目前来看,运行成本仍然占据主导。但转折点在于:论文指出,尽管我们正变得越来越擅长让芯片高效运行,但制造它们的成本即将爆炸式增长。到 2035 年,制造单个 AI 芯片所需的能量可能会比现在高出六到九倍。
为什么会发生这种情况?作者指出,让 AI 变得更聪明、更快速的最新技巧——例如使用“稀疏”(sparse)模型,即每次只唤醒大脑的一部分——实际上并不会缩小内存库的规模。即使 AI 在任何给定时刻只使用其知识的一小部分,它仍需要将所有这些知识存储在 HBM 堆栈中,以确保随时待命。因此,尽管芯片在执行特定任务时可能消耗较少的电力,但工厂仍然必须制造一个庞大的、高能耗的内存堆栈,来存放那些尚未被使用的数据。论文认为,我们陷入了一个陷阱:每当我们通过增加内存来提升 AI 的能力时,无论芯片后续运行得多么高效,制造该内存所产生的“隐含”(embodied)能量成本都会上升。
这项研究还展望了未来。如果目前的趋势持续下去,到 2035 年,这些芯片的制造能耗可能会达到每台设备 1,141 至 1,660 kWh。这比现在高出六到九倍。作者建议,仅仅通过优化芯片的运行性能并不能解决这个问题,因为这两类能量是由不同的因素驱动的。让芯片运行得更快就像是在调校引擎;而要让芯片制造起来更便宜,则需要彻底改变引擎的设计,例如使用不同的材料或不那么耗能的堆叠方法。
简而言之,这篇论文警告说,如果我们只关注 AI 数据中心在工作时消耗了多少电力,我们就会忽略环境故事中一个巨大的组成部分。制造硬件的“隐藏成本”正在快速增长,而我们今天用来节省电力的巧妙软件技巧,可能不足以阻止总能源账单的攀升。作者总结道,要真正理解 AI 对环境的影响,我们需要开始计算制造这些机器所需的能量,而不仅仅是运行它们所需的能量。他们建议,未来的解决方案可能需要侧重于减少我们需要制造的内存总量,而不仅仅是试图让现有的内存运行得更高效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。