← 最新论文
⚡ electrical engineering

Provisioning to Runtime Optimization of a +100 MW AI Cluster

本文首次对超大规模人工智能数据中心的电源管理提供了端到端的完整阐述,详细描述了从针对下一代加速器的早期电源规划到容纳 83,000 块 GB200 GPU 的 150 兆瓦设施的运行时优化的全过程。

原作者: Ehsan K. Ardestani, Leonardo Piga, Jovan Stojkovic, Pavan Balaji, Mustafa Ozdal, Mikel Jimenez Fernandez, Mihaela Dimovska, Luka Tadic, Hao Shen, Devika Vishwanath, Richa Mishra, Melaku Mihret, Valent
发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ehsan K. Ardestani, Leonardo Piga, Jovan Stojkovic, Pavan Balaji, Mustafa Ozdal, Mikel Jimenez Fernandez, Mihaela Dimovska, Luka Tadic, Hao Shen, Devika Vishwanath, Richa Mishra, Melaku Mihret, Valentin Andrei, Mauricio Cespedes, Julien Prigent, James Monahan, Tyler Graf, Bin Li, Charles Marquez, Shobhit Kanaujia, Kaushik Veeraraghavan, Chunqiang Tang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在建造世界上最大、最强大的超级计算机,以解决人工智能领域最棘手的问题。你已经斥资购买了数千枚能买到的最快计算机芯片(GPU)。但有一个棘手的问题:你没有足够的电力让它们全速运行。

事实上,这篇论文指出,如今电力短缺的问题比芯片短缺更为严重。这就像拥有一支由 100 辆赛车组成的车队,却只有足够给其中一半赛车加油的燃油。

这篇论文描述了 Meta(Facebook 背后的公司)如何为一个巨大的 150 兆瓦数据中心解决了这个问题。他们并没有只是把所有设备插上电然后听天由命;相反,他们将电力视为一种珍贵且有限的资源,并分三个阶段进行管理。

以下是他们如何做到的故事,使用了简单的类比。

电力管理的三个阶段

作者将整个过程分解为三个阶段:规划核查运行

第一阶段:规划(“预算”阶段)

在计算机甚至尚未抵达之前,团队就必须计算出在固定的电力预算下,他们能容纳多少台计算机。

  • 旧方法: 通常,工程师会查看芯片的“最大速度”(即热设计功耗,TDP),并假设这就是它始终使用的功率。如果一枚芯片额定功率为 1,200 瓦,他们就按 1,200 瓦来规划。
  • Meta 的方法: 他们意识到,如果强迫每枚芯片都以绝对最大功率运行,他们只能在建筑物里容纳几枚芯片。相反,他们问道:“如果我们让所有芯片稍微慢一点运行会怎样?”
  • 类比: 想象一个拥有固定食物量的自助餐。
    • 策略 A: 给每个人提供巨大的 10 道菜大餐。你只能喂饱 50 个人。
    • 策略 B: 给每个人提供稍小一点的 8 道菜大餐。现在你可以喂饱 60 个人。
    • 结果: 尽管每个人得到的食物略少,但整个群体消耗的食物量更高,且喂饱了更多人。
  • 发现: 他们发现,通过将每枚 GPU 的功率限制从 1,200 瓦降低到约 1,000 瓦,他们可以在数据中心容纳更多的 GPU。每枚单独芯片速度的轻微下降,被更多芯片协同工作所带来的优势完全弥补。这使他们的总计算能力提升了10%

第二阶段:核查(“现实检验”阶段)

一旦计算机安装完毕,团队意识到他们的计划与现实并不完全匹配。

  • 问题: 计算机内部的功率计(PSU)在撒谎。它们过于保守,报告机器消耗的功率比实际使用的要多。这就像汽车的燃油表总是显示“空”,而你实际上还剩下四分之一的油箱。
  • 修正: 他们将内部仪表与建筑物主电源传感器(非常准确)进行了比较。他们发现,如果忽略“最坏情况”的读数,转而查看“平均”使用情况(具体为第 70 百分位),他们就能更信任这些数字。
  • 结果: 由于不再信任那些过于保守的内部仪表,他们意识到自己拥有一些未被使用的“隐藏”电力。他们将功率稍微调高(从 1,000 瓦提升至 1,020 瓦),又榨取了**2%**的性能提升。

第三阶段:运行(“交通指挥”阶段)

现在,数据中心正在运行实时的 AI 训练任务。问题在于,AI 工作负载是“同步”的,这意味着所有芯片必须相互等待。如果一枚芯片变慢,整个任务都会变慢。

  • 问题: 有时,电网会出现突然的尖峰。如果系统检测到尖峰,旧的做法是立即关闭或减慢特定一枚芯片以节省电力。但在同步竞赛中,如果你让一名选手减速,整个团队都会输掉。
  • 解决方案(调光器): 他们构建了一个名为"Dimmer"的智能系统。它不是惩罚某一枚芯片,而是将任务中每一枚芯片的功率温和地降低一个微小的、相等的量。
  • 类比: 想象一群参加接力赛的跑步者。如果赛道变得湿滑(功率限制),教练不是让一名选手绊倒(这将导致整个团队停止),而是告诉所有人稍微慢一点点跑。团队保持同步,比赛得以继续而不中断。
  • 结果: 这防止了系统崩溃,并使他们能够利用之前被浪费的最后几个百分点的“闲置”电力。这又带来了约**2%**的提升。

其他关键见解

  • “瓶颈”效应: 数据中心是不同硬件(计算机、冷却系统、网络交换机)的混合体。有时,功率限制并非由计算机设定,而是由冷却系统或网络电缆设定。如果链条中的某一部分薄弱,它就会限制整个链条。
  • 电力波动: 当 AI 芯片工作时,它们有时会暂停一瞬间以相互通信,导致电力消耗先下降后激增。团队创建了一个“软件平滑器”,用虚拟工作填充这些微小的间隙,使电力消耗像平静的河流一样稳定,而不是像波涛汹涌的大海。这保护了建筑物的电网免受冲击。
  • 越新越好: 他们将新芯片(GB200)与旧芯片(H100)进行了比较。新芯片的效率如此之高,以至于尽管每枚芯片的功耗更低,但在新集群中,其速度几乎是旧集群在同一建筑物中速度的两倍

结论

通过将电力视为一种灵活的资源而非固定限制,并从规划阶段到日常运营对其进行精心管理,Meta 在不建造一面新墙或购买一根新电线的情况下,使其 150 兆瓦数据中心的计算能力提升了约14%

他们并没有找到神奇的电池;他们只是学会了如何更明智地利用已有的电力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →