From Tokens to Watt-hours: Analytical Energy Estimation for LLM Inference on Modern GPUs
本論文は、ワークロードを演算成分とメモリトラフィック成分に分解することにより、直接的なハードウェア測定を必要とせずに、透明かつ再現可能なエネルギー評価を可能にする、NVIDIA H100 GPUにおけるLLM推論のエネルギー消費量を推定するための、経験的に較正された解析的手法を導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットを、何百万人もの人々が魔法の司書(人工知能)に対して、物語を書いたり、数学の問題を解いたり、ニュースを要約したりすることを絶えず求めている、巨大で賑やかな図書館だと想像してみてください。長い間、私たちはこの司書がその技を習得するためにどれほどの「脳の力」(学習)を必要とするかということばかりを心配してきました。しかし今、司書は毎日、何百万もの質問に答えるために休みなく働いています。この絶え間ない作業は膨大な量の電力を消費し、それは地球にとって良くありません。科学者やエンジニアにとっての大きな疑問は、「たった一つの質問に答えるために、実際にはどれだけのエネルギーが必要なのか?」ということです。問題は、エネルギーを直接測定することは、ハリケーンに吹き飛ばされている一粒の砂の重さを量ろうとするようなものであり、特別な、高価なセンサーと完璧な条件がなければ不可能であるということです。エネルギーコストを推測する方法がなければ、あるAIが他よりも「環境に優しい」のか、あるいは特定の質問の仕方が電力を無駄にしているのかを知ることは困難です。
「Tokens から Watt-hours へ(From Tokens to Watt-hours)」と題されたこの論文は、電力計をコンセントに差し込むことなく、このパズルを解くための巧妙な方法を提案しています。著者である大学やテック企業の研究チームは、AIのサイズと会話の長さを見るだけで、そのAIがどれだけのエネルギーを使用するかを推定する、数学的な「計算機」を構築しました。これは、AIの「栄養成分表示」のようなものです。カロリーを数える代わりに、「ワット時(Watt-hours)」(エネルギーの単位)を数えるのです。彼らは、この計算機を、現代の最も賢いAIのエンジンとなっているNVIDIA H100と呼ばれる強力なコンピュータチップでテストしました。
彼らの計算機の仕組みを、簡単な比喩を使って説明します。AIをキッチンにいるシェフだと想像してください。料理を作る(答えを生成する)ために、シェフは二つのことを行います。まず、レシピを読み、材料を集めます(これが「演算(compute)」の部分です)。そして、スパイスや道具を取りにパントリー(食品庫)へ何度も往復します(これが「メモリ(memory)」の部分です)。研究者たちは、短い注文の場合、シェフは主に料理することに集中するため、エネルギーコストは主に調理に関するものであることを見出しました。しかし、長く複雑な注文の場合、シェフはパントリーへ何度も走り回らなければならず、そのために費やされるエネルギーが請求額の中で支配的になり始めます。
論文では、エネルギーコストを二つの主要なフェーズに分解しています。
- 「プリフィル(Prefill)」フェーズ: これは、シェフが顧客の注文(入力プロンプト)を読む段階です。ここでのエネルギーコストは、注文の長さに依存します。
- 「デコード(Decode)」フェーズ: これは、シェフが答えを一語一語書いていく段階です。ここでのエネルギーコストは、答えの長さに依存します。
研究者たちは、エネルギーコストが単にAIがいかに大きいか(どれだけの「材料」やパラメータを持っているか)だけでなく、会話がどれほど長くなるかに大きく依存することを発見しました。彼らは、答えが長くなるにつれて、エネルギーは単に直線的に上昇するのではなく、急激に曲線を描いて上昇することを見出しました。なぜでしょうか? それは、AIが新しい言葉を一つ書き加えるたびに、物語の意味を理解するために、それまでのすべての言葉を振り返って確認する必要があるからです。まるで、シェフが塩をひとつまみ加えるたびに、レシピ全体を読み直さなければならないようなものです。レシピが長ければ長いほど、より多くの往復が必要になり、より多くのエネルギーが浪費されます。
彼らの公式を用いて、チームは、小さなAI(約3億パラメータ)は、一つのリクエストに対して約0.001ワット時の非常に少ないエネルギーしか使用しないことを算出しました。一方で、巨大なAI(1200億パラメータ)は、同じタスクに対して約0.15ワット時というはるかに多くのエネルギーを使用します。また、彼らは、700億パラメータのモデルにおいて、彼らの推定値が他の科学者による実世界の測定値と非常に近い(誤差5%以内)ことを示し、電力計で直接測定できない場合でも、彼らの「計算機」が十分に信頼できることを証明しました。
論文は、このツールは電力計で電気を測定するものの完全な代わりにはならないことを明記しています。これは、エアコンやインターネットケーブル、あるいはデータセンター内の他のコンピュータが使用するエネルギーをカウントしていません。それは、思考を行っている特定のチップが使用するエネルギーのみをカウントしています。しかし、著者らは、このチップのエネルギーこそが、エンジニアが制御できる最大の要因であると主張しています。
では、これは将来にとって何を意味するのでしょうか? 論文は、もし私たちがエネルギーを節約したいのであれば、単に大きなAIを作ろうとするのではなく、代わりに「レシピ」を短くしたり(入力を圧縮する)、短い答えを求めたり、あるいは単純な仕事のために小さくて専門化された「シェフ」を使ったりすべきであると示唆しています。著者らは、この計算機が開発者たちが異なるAIモデルを比較し、よりエネルギー効率の高いものを選べるようにすることで、すべてのコンピュータに電力計を設置することなく、より「グリーンな」デジタル世界を築く助けとなることを願っています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。