From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs
本文介绍了一种经过经验校准的分析方法,通过将工作负载分解为计算和内存流量组件,用于估算 NVIDIA H100 GPU 上大语言模型(LLM)推理的能耗,从而在无需直接进行硬件测量的情况下,实现透明且可复现的能量评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一座巨大的、繁忙的图书馆,数以百万计的人不断向一位神奇的图书管理员(人工智能)提问,让它写故事、解数学题或总结新闻。长期以来,我们只担心这位图书管理员学习这些技巧需要多少“脑力”(训练)。但现在,这位图书管理员正在不间断地工作,每天回答数百万个问题。这种持续的工作消耗了大量的电力,这对地球并不利。科学家和工程师面临的一个大问题是:“回答一个问题究竟需要多少能量?”问题的难点在于,直接测量这种能量就像是在飓风中试图称量一粒沙子的重量;你需要特殊的、昂贵的传感器和完美的环境,而大多数人并不具备这些条件。如果没有一种方法来估算能量成本,我们就很难知道哪一个 AI 更“绿色”,或者某种特定的提问方式是否在浪费电力。
这篇题为《从 Token 到瓦时》(From Tokens to Watt-hours)的论文提供了一种巧妙的方法来解决这个难题,而无需插上功率计。作者们是一群来自大学和科技公司的研究人员,他们构建了一个数学“计算器”,通过观察 AI 的规模和对话的长度来估算它使用了多少能量。你可以把它想象成 AI 的“营养标签”:它不计算卡路里,而是计算“瓦时”(能量的单位)。他们在被称为 NVIDIA H100 的强大计算机芯片上测试了这个计算器,这些芯片是驱动当今许多最智能 AI 的引擎。
以下是他们的计算器是如何工作的,我们用一个简单的类比:想象 AI 是厨房里的一位厨师。为了烹饪一顿饭(生成答案),厨师要做两件事:他们阅读食谱并收集食材(这是“计算”部分),然后他们跑回储藏室去拿香料和工具(这是“内存”部分)。研究人员发现,对于短订单,厨师主要是在进行烹饪,所以能量成本主要在于烹饪。但对于长而复杂的订单,厨师必须频繁地跑向储藏室,这时跑来跑去的能量消耗就开始占据主导地位。
论文将能量成本分解为两个主要阶段:
- “预填充”(Prefill)阶段: 这是厨师阅读客户订单(输入提示词)的时候。这里的能量成本取决于订单的长短。
- “解码”(Decode)阶段: 这是厨师逐字逐句写出答案的时候。这里的能量成本取决于答案的长短。
研究人员发现,能量成本不仅仅取决于 AI 有多大(它有多少“食材”或参数),还很大程度上取决于对话变得多长。他们发现,随着答案变得越来越长,能量并不仅仅是呈直线增长;它会急剧向上弯曲。为什么呢?因为 AI 每写出一个新词,都需要回头看之前所有的词,才能理解故事的意思。这就像厨师每加一小撮盐,就得把整份食谱重新读一遍。食谱越长,跑来跑去的需求就越多,消耗的能量也就越多。
利用这个公式,团队计算出,一个小型 AI(约有 3 亿参数)在处理一次请求时消耗的能量非常少,大约为 0.001 瓦时。但一个巨大的 AI(拥有 1200 亿参数)在执行相同任务时则消耗更多——大约为 0.15 瓦时。他们还展示了,对于一个 700 亿参数的模型,他们的估算值与其它科学家进行的真实世界测量结果非常接近(误差在 5% 以内),这证明了在无法直接测量功率的情况下,他们的“计算器”足够可靠。
论文明确指出,这个工具并不能完美替代使用电表测量电力。它没有计算空调、互联网电缆或其他数据中心计算机所消耗的能量。它只计算正在进行思考的特定芯片所使用的能量。然而,作者认为,这部分芯片能量是工程师可以控制的最大开支。
那么,这对未来意味着什么?论文建议,如果我们想要节省能源,我们不应该仅仅尝试制造更大的 AI。相反,我们应该尝试缩短“食谱”(压缩输入)、要求更短的答案,或者为简单的任务使用更小、更专业的“厨师”。作者希望这个计算器能帮助开发者比较不同的 AI 模型并选择那些更具能效的模型,从而在不需要在每台计算机上都安装功率计的情况下,帮助建设一个更“绿色”的数字世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。