← 最新论文
🤖 machine learning

Energy Scaling Laws for Diffusion Models: Quantifying Compute in Image Generation

本文提出了一种改进的卡普兰缩放定律,通过将推理过程分解为文本编码、去噪和解码三个组成部分,准确预测扩散模型的 GPU 能耗,证明了去噪过程主导能耗,并实现了可持续 AI 规划中可靠的跨架构估算。

原作者: Aniketh Iyengar, Jiaqi Han, Boris Ruf, Vincent Grari, Marcin Detyniecki, Stefano Ermon

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Aniketh Iyengar, Jiaqi Han, Boris Ruf, Vincent Grari, Marcin Detyniecki, Stefano Ermon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常昂贵、功能强大的厨房机器人(GPU),它能将一堆杂乱的食材变成完美、逼真的蛋糕(图像)。这个机器人并非一次性完成烘焙;它必须混合、品尝、调整,再混合,如此反复数十次,才能让质地恰到好处。这正是扩散模型生成图像的工作原理。

问题在于,这个机器人非常耗电。蛋糕越复杂(分辨率越高),它需要混合的次数越多(步数越多),你的电费账单就越高。

这篇论文就像是为这些图像生成机器人配备的智能能耗计算器。作者们希望回答一个简单的问题:“如果我改变蛋糕的大小、机器人的类型,或者混合的次数,能否在不实际运行机器人的情况下,准确预测它将消耗多少电力?”

以下是他们研究发现的日常类比解析:

1. 能量的“食谱”(缩放定律)

作者们借鉴了语言模型领域的一个著名规则(称为Kaplan 缩放定律),并将其调整用于图像生成。可以将此规则视为一个通用食谱,它指出:“机器人做的工越多,它消耗的能量就越多。”

他们发现,对于这些图像机器人而言,这种关系几乎是完全线性的。如果你将机器人需要进行的数学运算量(称为FLOPs)翻倍,其能耗也会大致翻倍。这就像开车:如果你行驶的距离加倍,消耗的汽油也会加倍。

2. “混合”是主要耗能环节

当机器人制作蛋糕时,包含三个部分:

  1. 读取订单(文本编码):读取你想要什么样的蛋糕。
  2. 混合面糊(迭代去噪):实际的烘焙过程,即清理噪声。
  3. 装盘蛋糕(解码):组装最终图像。

论文发现,第 2 步(混合)是主要的耗能环节。它占据了总能耗的90% 以上。机器人几乎将所有时间和电力都耗费在重复的混合过程上,而不是读取订单或装盘。这就是电费账单如此高昂的原因:机器人必须为单张图像混合面糊 10 到 50 次。

3. “机器人模型”的影响不如你想象的那么大

研究人员在四种不同类型的机器人(Stable Diffusion 2、Stable Diffusion 3.5、Flux 和 Qwen)以及三种不同类型的厨房(NVIDIA A100、A4000 和 A6000 GPU)上测试了这一规则。

令人惊讶的是:这一规则在所有情况下都适用。

  • 如果你知道"Flux"机器人消耗多少能量,你就可以用同样的数学公式来预测"Qwen"机器人的能耗,即使它们的构造不同。
  • 无论你使用的是专业数据中心的机器人(A100)还是高端工作站的机器人(A6000),“完成的工作量”与“消耗的能量”之间的关系都保持一致。

这就像发现,无论你驾驶的是丰田还是福特,如果你以相同的速度行驶相同的距离,消耗的燃料大致相同。你无需测试路上的每一辆车就能知道燃油成本;你只需要知道距离和速度即可。

4. 改变账单的“旋钮”

论文还探讨了当你调节机器人的“旋钮”时会发生什么:

  • 分辨率(大小):将图像尺寸从 256x256 增加到 1024x1024,就像要求机器人烘焙一个巨大的婚礼蛋糕,而不是纸杯蛋糕。能耗成本会急剧上升。
  • 精度(准确度):使用"float32"(超高精度)与"float16"(标准精度),就像要求机器人用显微镜级别的秤而不是厨房秤来测量食材。超高精度模式消耗的能源显著更多(在某些情况下约为 7 倍)。
  • 步数(混合):要求机器人混合 50 次而不是 10 次,就像要求它搅拌面糊一小时而不是十分钟。能耗成本呈线性增长。

5. 为什么这很重要(“那又怎样?”)

在这篇论文之前,如果一家公司想要知道为百万用户运行图像生成器需要多少成本,他们必须实际运行系统并测量电表。这就像通过抛硬币来猜测你的电费账单。

现在,他们拥有了一个预测工具

  • 对于规划者:公司可以说:“如果我们切换到这种新机器人并要求生成 4K 图像,这就是我们将需要的确切电量”,而无需先购买机器人。
  • 对于环境:它有助于我们了解人工智能的“碳足迹”。论文指出,生成一张高质量图像所消耗的能量,相当于 10 次典型的基于文本的 AI 聊天(例如向聊天机器人提问)。

总结

该论文证明,图像生成中的能耗是可预测的。它遵循一个简单的数学规则:更多数学运算 = 更多能量。通过理解这一规则,我们可以更好地规划、选择合适的设备,并了解创建数字艺术的环境成本,而无需进行任何一次实际测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →