← 最新论文
⚡ electrical engineering

Measurement of Generative AI Workload Power Profiles for Whole-Facility Data Center Infrastructure Planning

该论文提出了一种将高分辨率生成式 AI 工作负载功耗测量与全设施能源需求相结合的方法,通过利用 NLR 高性能计算数据中心实测数据构建公开数据集,并采用自下而上的事件驱动模型进行扩展,从而生成反映真实时间波动的全设施能源画像,以指导电网接入、现场能源生成及分布式微电网等基础设施规划。

原作者: Roberto Vercellino (National Laboratory of the Rockies), Jared Willard (National Laboratory of the Rockies), Gustavo Campos (National Laboratory of the Rockies), Weslley da Silva Pereira (National Lab
发布于 2026-04-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Roberto Vercellino (National Laboratory of the Rockies), Jared Willard (National Laboratory of the Rockies), Gustavo Campos (National Laboratory of the Rockies), Weslley da Silva Pereira (National Laboratory of the Rockies), Olivia Hull (National Laboratory of the Rockies), Matthew Selensky (National Laboratory of the Rockies), Juliane Mueller (National Laboratory of the Rockies)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一份**“数据中心电力消耗的深度体检报告”,专门针对现在最火的生成式人工智能(GenAI)**。

想象一下,数据中心的电力消耗就像是一个超级繁忙的厨房。以前,我们只知道这个厨房一天大概用多少电,但不知道厨师(AI 程序)在切菜、炒菜还是洗碗时,火苗具体是怎么跳动的。这篇论文就是要把这些细节拍下来,算清楚,帮未来的“厨房设计师”们规划怎么供电。

以下是用大白话和生动比喻对这篇论文核心内容的解读:

1. 为什么要写这篇论文?(背景与痛点)

  • 现状: 现在的 AI 太火了,像大语言模型(LLM)和画图 AI,它们吃电像“吞金兽”。数据中心的用电量正在爆炸式增长。
  • 问题: 但是,很多关于 AI 到底吃多少电的数据都是商业机密(像大公司的秘密配方),或者数据太粗糙(只知道一天用了多少,不知道每一秒怎么用的)。
  • 后果: 这导致电网公司、建数据中心的工程师们像是在**“盲人摸象”**。他们不知道什么时候需要备足电力,什么时候可以省电,甚至不知道电网会不会因为突然的大负荷波动而“跳闸”。

2. 他们做了什么?(核心方法)

研究人员在科罗拉多州的一个国家实验室里,搭建了一个**“微型 AI 厨房”**(使用 NVIDIA H100 这种顶级显卡),然后做了一件非常细致的工作:

  • 高精度“听诊”: 他们以0.1 秒为单位(眨眼都来不及的时间),记录了 AI 在训练(学习新知识)、微调(调整模型)和推理(回答问题)时的电力消耗。
    • 比喻: 就像给厨师装了一个超级灵敏的听诊器,不仅知道厨师一天吃了多少饭,还能知道他在切洋葱时心跳多快,炒菜时火苗多大。
  • 标准化测试: 他们用了行业通用的“考试题目”(MLCommons 和 vLLM 基准测试),确保大家测出来的结果是可以互相比较的,就像大家都用同样的试卷考数学。
  • 从“单点”到“全景”的放大: 他们不仅测了一个服务器的电,还开发了一个叫 DIPLOEE 的**“模拟器”**。
    • 比喻: 就像你知道了做一道菜(一个 AI 任务)需要多少火,然后通过模拟器,推算出如果这个厨房里有 1000 个厨师同时在做菜,整个厨房的总用电量会是什么样。这个模拟器还能模拟用户什么时候来点菜(用户行为),从而预测全天的用电高峰和低谷。

3. 他们发现了什么?(关键发现)

A. AI 训练(学习过程):像“马拉松”

  • 现象: 当 AI 在“学习”(训练)时,电力消耗会随着机器数量增加而线性增长。
  • 意外发现: 机器越多,虽然算得越快,但总耗电量反而可能增加
    • 比喻: 就像让 10 个人一起搬砖,虽然搬得快了,但大家互相喊口号、协调动作(通信)消耗的能量,加上每个人多跑了几趟,导致总油耗比 2 个人搬砖还要高。
  • 启示: 并不是机器越多越省电,有时候“贪多嚼不烂”。

B. AI 推理(回答问题):像“脉冲式”工作

  • 现象: 当 AI 在回答问题(推理)时,电力消耗不是恒定的,而是忽高忽低
    • 比喻: 就像厨师在等客人点菜(空闲),客人来了就猛火快炒(高功耗),炒完又停下来等下一单。这种“脉冲式”的用电,会让电网像坐过山车一样。
  • 饱和效应: 当请求太多时,服务器会“忙不过来”,电力消耗反而不会无限增加,而是达到一个天花板(饱和)。这时候,虽然电没多花,但用户等待的时间(延迟)会变长,体验变差。

4. 这对我们意味着什么?(实际应用)

研究人员用他们的模拟器,模拟了两个场景:

  1. 大型托管数据中心(像一个大仓库): 里面有很多不同的公司租机器跑 AI。
  2. 推理数据中心(像一家快餐店): 专门负责实时回答用户问题。

主要结论:

  • 电网稳定性: 即使所有机器都在满负荷工作,实际用电量往往也达不到设计上限的 100%(大概只有 70%-80%)。这意味着我们之前的规划可能过于保守了,或者我们可以更聪明地利用现有的电力资源。
  • 削峰填谷: 用户的习惯(比如白天工作忙,晚上休息)会导致数据中心用电有明显的昼夜和周循环
  • 规划建议: 未来的数据中心设计,不能只按“最大可能”去建电网,而要根据这种真实的、有波动的用电曲线来设计。比如,可以配合太阳能(白天用)或者电池储能(晚上用),甚至利用 AI 的“脉冲”特性,在电网负荷低的时候多跑任务。

总结

这篇论文就像给 AI 数据中心做了一次**“CT 扫描”**。它告诉我们:AI 吃电不是简单的“开灯就亮”,而是像呼吸一样有节奏、有起伏。

它的最大贡献是: 把**“微观的服务器电力数据”“宏观的电网规划”**连接了起来。通过公开这些数据和模拟工具,它帮助工程师、电网公司和政策制定者更聪明地规划未来的能源基础设施,避免因为 AI 的爆发式增长而导致电网崩溃或资源浪费。

一句话概括: 我们终于不再盲目猜测 AI 吃多少电了,现在我们可以拿着“精准食谱”来规划未来的能源厨房了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →