← 最新の論文
🤖 machine learning

Energy Scaling Laws for Diffusion Models: Quantifying Compute in Image Generation

本論文は、推論をテキストエンコーディング、ノイズ除去、デコーディングの各構成要素に分解することで拡散モデルのGPUエネルギー消費を正確に予測する適応型カプランの法則を提案し、ノイズ除去がエネルギー消費を支配することを示すとともに、持続可能なAI計画のための信頼性の高いアーキテクチャ横断的な推定を可能にするものである。

原著者: Aniketh Iyengar, Jiaqi Han, Boris Ruf, Vincent Grari, Marcin Detyniecki, Stefano Ermon

公開日 2026-05-14
📖 1 分で読めます☕ さくっと読める

原著者: Aniketh Iyengar, Jiaqi Han, Boris Ruf, Vincent Grari, Marcin Detyniecki, Stefano Ermon

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に高価で高性能なキッチンロボット(GPU)を想像してください。このロボットは、散らかった材料の山を完璧で写実的なケーキ(画像)に変えることができます。このロボットは一度でケーキを焼き上げるわけではありません。テクスチャーを完璧にするために、数十回も混ぜ、味見し、調整し、再び混ぜる必要があります。これが画像を生成する拡散モデルの仕組みです。

問題は、このロボットが大量の電力を消費するということです。ケーキが複雑になるほど(解像度が高くなるほど)、そして混ぜる回数が増えるほど(ステップ数が増えるほど)、電気代は高くなります。

この論文は、これらの画像生成ロボットのための賢いエネルギー計算機のようなものです。著者たちは、単純な問いに答えようとしていました。「ケーキのサイズ、ロボットのタイプ、または混ぜる回数を変えれば、ロボットを実際に動かさずに、正確にどれだけの電力を消費するか予測できますか?」

以下に、彼らの発見を日常的な比喩を用いて解説します。

1. エネルギーの「レシピ」(スケーリング則)

著者たちは、言語モデルの世界で有名なルール(カプランのスケーリング則と呼ばれるもの)を画像生成用に適応させました。このルールは、以下のような普遍的なレシピと考えることができます。「ロボットがする仕事が増えれば、消費するエネルギーも増える」というものです。

彼らは、これらの画像ロボットにおいて、この関係がほぼ完全に直線的であることを発見しました。ロボットが処理しなければならない数学的な計算量(FLOPs)を倍にすれば、消費エネルギーもほぼ倍になります。車を運転するのと同じです。走行距離を倍にすれば、ガソリンの消費量も倍になります。

2. 「混ぜる」工程が最も重労働

ロボットがケーキを作る際、3 つのパートがあります。

  1. 注文を読む(テキストエンコーディング):どのようなケーキが欲しいかを読み取る。
  2. 生地を混ぜる(反復的なノイズ除去):ノイズを除去する実際の焼き工程。
  3. ケーキを盛り付ける(デコーディング):最終的な画像を完成させる。

この論文によると、ステップ 2(混ぜる工程)が最も重労働です。消費エネルギーの90% 以上を占めています。ロボットは注文を読んだりケーキを盛り付けたりするのではなく、ほぼすべての時間と電力を、反復的な混ぜ作業に費やしています。これが電気代が高くなる理由です。1 枚の画像を作るために、ロボットは生地を 10 回から 50 回も混ぜなければならないからです。

3. 「ロボットモデル」は思っているほど重要ではない

研究者たちは、このルールを 4 種類の異なるロボット(Stable Diffusion 2、Stable Diffusion 3.5、Flux、Qwen)と、3 種類の異なるキッチン(NVIDIA A100、A4000、A6000 GPU)でテストしました。

ここが驚きです:このルールはすべてに通用します

  • 「Flux」ロボットが消費するエネルギーがわかれば、同じ数学を使って「Qwen」ロボットが消費するエネルギーを予測できます。たとえそれらが異なる構造で作られていたとしてもです。
  • プロフェッショナルなデータセンター用のロボット(A100)を使おうが、ハイエンドなワークステーション用のロボット(A6000)を使おうが、「行われた仕事」と「消費されたエネルギー」の関係は一貫しています。

これは、トヨタかフォードかに関わらず、同じ距離を同じ速度で運転すれば、おおよそ同じ量の燃料を消費するという発見に似ています。燃料コストを知るために道路のすべての車をテストする必要はありません。距離と速度さえわかればよいのです。

4. 電気代を変える「つまみ」

この論文は、ロボットのつまみを回したときに何が起こるかも検討しました。

  • 解像度(サイズ):画像を大きくする(256x256 から 1024x1024 へ)ことは、ロボットにカップケーキではなく巨大なウェディングケーキを焼くように頼むようなものです。エネルギーコストは劇的に跳ね上がります。
  • 精度(正確さ):「float32」(超高精度)を使うか「float16」(標準精度)を使うかは、ロボットに台所用の秤ではなく、顕微鏡レベルの精密秤で材料を測るように頼むようなものです。超高精度モードは、はるかに多くのエネルギーを消費します(場合によっては約 7 倍)。
  • ステップ数(混ぜる回数):ロボットに 10 回ではなく 50 回混ぜるように頼むことは、10 分ではなく 1 時間生地を混ぜるように頼むようなものです。エネルギーコストは線形的に増加します。

5. なぜこれが重要なのか(「だから何?」)

この論文以前は、企業が 100 万人のユーザー向けに画像生成システムを動かすのにどれだけのコストがかかるかを知りたい場合、実際にシステムを稼働させて電力メーターを測定する必要がありました。それは、コインを投げて電気代を当てるようなものでした。

現在、彼らは予測ツールを持っています。

  • 計画担当者にとって:企業は、「この新しいロボットに切り替え、4K 画像を要求すれば、ロボットを先に購入しなくても、正確にどれだけの電力が必要か」を言うことができます。
  • 環境にとって:AI の「炭素フットプリント」を理解するのに役立ちます。この論文は、1 枚の高品質な画像を生成するエネルギーは、チャットボットに質問するなど、10 回分の一般的なテキストベースの AI チャットと同じくらい多いと指摘しています。

まとめ

この論文は、画像生成におけるエネルギー消費は予測可能であることを証明しています。それは単純な数学のルールに従います。計算量が増えれば、エネルギーも増える。このルールを理解することで、単一のテストを実行する必要なく、より良い計画を立て、適切な機器を選択し、デジタルアートを創作する際の環境コストを理解することができます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →