← 最新论文
🤖 machine learning

The Model Parking Tax: Quantifying the Hidden Energy Cost of Always-On GPU Model Deployment

本文通过实证表明,将 AI 模型加载至 GPU 内存中的能耗主要由 CUDA 上下文 DVFS 转换引发的离散功率增加所驱动,而非显存占用量,从而揭示出模型部署的能耗最优策略取决于请求到达率和冷启动延迟,而非模型规模。

原作者: Sai Sathvik Vadari

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Sai Sathvik Vadari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《模型停车税》的解释。

核心理念:AI 的“停车税”

想象你经营着一家繁忙的餐厅。你有一条规定:“一旦为贵宾客人摆好了餐桌,即使没人坐,我们也永远保持餐桌的摆设。”

为什么?因为如果有新客人到来,你不想浪费时间重新摆放餐具、餐巾和菜单。你希望他们能立刻坐下用餐。

在 AI 领域,公司对待名为GPU(图形处理器)的强大计算机芯片也采取同样的做法。当他们把 AI 模型(如聊天机器人)加载到 GPU 上时,即使没人向它提问,也会让它一直运行,24 小时不间断。他们这样做是为了避免“冷启动”延迟——即从零开始加载模型所需的时间。

问题所在:这篇论文指出,将这些 AI 模型“停泊”在 GPU 上极其浪费电力,而且原因出乎所有人的意料。

隐藏的成本:不在于汽车的“大小”

大多数人认为,在 GPU 上保持一个巨大的 AI 模型(如拥有 700 亿参数的怪物)运行,比保持一个微小的模型(如 70 亿参数模型)消耗更多的电力,因为大模型在 GPU 的显存(VRAM)中占据了更多空间。

论文的重大发现:这是错误的。

作者在三种不同类型的高端 GPU(H100、A100 和 L40S)上进行了测量。他们发现,“停放”模型的电力成本几乎完全取决于启动引擎,而不是汽车在车库中占据了多少空间。

类比:怠速的汽车

把 GPU 想象成汽车引擎:

  1. 完全熄火:汽车关闭。引擎是冷的。它几乎不消耗燃油。
  2. “上下文”(引擎启动):一旦你转动钥匙启动汽车(创建"CUDA 上下文”),引擎就会高速空转,以便随时准备立即行驶。
    • 令人震惊的一点:一旦引擎开始高速空转,无论你是在后备箱里放一辆微型自行车还是一辆巨大的卡车,引擎仍然以相同的高速空转,消耗相同量的燃油。

论文将这种现象称为"模型停车税"。

  • 税收:一旦你加载任何模型,就必须支付一笔固定的电力费用(根据芯片不同,在 26 到 66 瓦之间)。
  • 意外之处:增加更多内存来容纳更大的模型,几乎不会增加额外成本。无论你停放的是 1GB 的模型还是 64GB 的模型,电费账单都是一样的。

他们是如何发现这一点的

研究人员没有凭空猜测,而是做了两件事:

  1. 现实世界的观察:他们在数据中心观察了 14 块真实的 GPU,持续 18 天,进行了数十万次测量。他们发现,当模型被加载时,功耗会上升,但改变模型大小并不会改变功耗。
  2. 受控实验:他们选取了三种不同类型的 GPU,系统地将它们的内存从空填满,就像往桶里倒水一样。他们在每一步都测量了功耗。
    • 结果:功耗线是平的。往桶里倒更多的“水”(内存)并不会让“引擎”更努力地工作。

“盈亏平衡”时刻

那么,我们应该关掉引擎以节省燃油吗?论文说是的,但前提是你等待的时间足够长。

他们计算了一个“盈亏平衡点”。这是指你需要等待多长时间,才会发现关掉引擎并在稍后重新启动比让它怠速更划算。

  • 数学计算:对于大多数现代设置,如果你1 到 5 分钟内没有收到请求,实际上关掉模型并在有人请求时重新加载会更便宜。
  • 关键点:小模型是浪费最严重的。它们几秒钟就能加载完毕,因此使用后应立即关闭。但大模型加载时间较长,所以你可能需要让它们多运行一会儿。然而,论文指出,“税收”对两者是一样的,因此如果小模型被保持开启,它们是最浪费的。

解决方案:更智能的调度器

作者构建了一个简单的“智能停车计时器”(即调度器)。该系统不再让模型永远保持开启,而是检查:“距离上一次请求是否已超过 5 分钟?”

  • 如果:将其关闭。
  • 如果:保持开启。

当他们测试这一系统时,与标准的“永远开启”方法相比,节省了**8% 到 23%**的电力,且用户几乎感觉不到延迟。

结论

  • 误区:“我们必须让大型 AI 模型在 GPU 上 24 小时运行,因为它们加载时间太长。”
  • 现实:保持它们运行的成本是由 GPU 引擎高速空转引起的固定“停车费”。模型的大小无关紧要。
  • 对策:我们应该更频繁地关闭这些模型。如果一个模型几分钟内未被使用,就将其关闭。这能节省巨大的能源(整个行业每年可能节省数百吉瓦时),而不会损害性能。

简而言之:你不需要仅仅因为后备箱很大就让引擎一直运转。如果你不驾驶,就把车关掉。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →