← 最新の論文
🤖 AI

Energy Efficiency of Locally Deployed LLMs: A Preliminary Quantitative GPU Power Benchmark on Consumer Hardware

本論文は、コンシューマー向けGPUであるRTX 4060Tiを用いた9つのオープンソースLLMの定量的ベンチマークを提示しており、エネルギー効率はパラメータ数よりもモデルのアーキテクチャや量子化によって左右されることを明らかにしており、gemma3やllama3.2のような1Bモデルがトークンあたりのエネルギーコストを最も低く抑えている一方で、7B-Mistralのような大型モデルは著しく多くのエネルギーを消費している。

原著者: Philipp M. Zähl, Anika Hennig

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Philipp M. Zähl, Anika Hennig

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、自分のコンピュータの中に住み、質問に答えたり、物語を書いたり、コードを書くのを手伝ったりしてくれる、超スマートなロボットの友人を作り上げたばかりです。しかも、あなたの秘密を巨大なクラウドサーバーに送ることは決してありません。これが「ローカル」人工知能の世界です。プライバシーとスピードを求める人々によって、このトレンドは爆発的に広がっています。しかし、一つ問題があります。これらの知的なロボットは、非常に「食欲旺盛」なのです。巨大なスーパーコンピュータでこれらの大規模なAIの脳をトレーニングする際に、膨大な電力を消費すること(まるで小さな都市を一日中動かすようなもの)は以前から知られていましたが、一般的な家庭用コンピュータで彼らと「会話」するだけでどれほどのエネルギーが必要なのかについては、実はあまり分かっていませんでした。それは、車が高速道路でひどい燃費であることは知っているけれど、ドライバーとチャットしている間に、ドライブウェイでアイドリングしているだけでどれくらいの燃料を消費しているのかは全く分からない、という状態に似ています。より多くの人々が、自分のノートパソコンやゲーミングPCでこれらのAIアシスタントを動かし始めるにつれ、この「アクティブ」なエネルギー消費量への理解は、個人の財布にとっても地球にとっても切実な懸実はなります。

まさにここで、ドイツのアーヘン応用科学大学の研究チームが立ち上がりました。彼らは、普及している無料で使用可能なAIモデルの中で、標準的な消費者向けグラフィックスカード(具体的には、ハイエンドなゲーミングPCに見られるようなNVIDIA RTX 4060 Ti)で実行した際に、最も「エネルギー効率」が良いのはどれかを調べたいと考えました。彼らは単に「どのモデルが最高の回答を出すか?」と問うのではなく、「どのモデルが最小限の電気をすすりながら、最高の回答を出すか?」と問いかけたのです。彼らは、10億パラメータの極小モデルから70億パラメータのより大きなモデルまで、9種類の異なるオープンソースAIモデルに対して、「フランスの首都は何ですか?」といった単純な事実から、コードを書いたり深い概念を説明したりする複雑なタスクまで、固定された15個の質問を与え、制御された実験環境を構築しました。

研究者たちは、エネルギー探偵として振る舞いました。モデルが動作している間、nvidia-smi というツールを使用して、グラフィックスカードの消費電力を1秒間に2回チェックしました。極めて重要なのは、彼らが総電力量を測定しただけでなく、カードのベースラインとなる「アイドル時」の電力を注意深く差し引くことで、AIの思考プロセスによる正確なエネルギーコストを分離したことです。彼らの主な目的は、回答の単語(または「トークン」)1つを生成するために、合計でどれだけのエネルギー(ジュール)が必要かを算出することでした。彼らの調査結果は、必ずしも「大きいことが常に良い」わけではないことを示唆しています。実際、極小モデル、特に gemma3:1bllama3.2:1b が効率性のチャンピオンであることが判明しました。これらの小さな強力なモデルは、わずか0.56ジュールのエネルギーで単語1つを生成し、1秒間に170語以上のテキストを吐き出すことができました。

対照的に、70億パラメータを持つ大型モデル(Mistral)ははるかに効率が悪く、最も効率的な極小モデルよりも、単語1つあたり最大4.4倍のエネルギーを消費しました。また、研究では奇妙な驚きも明らかになりました。qwen3.5:2b というモデルの一つが、プロンプト1回につき驚くほど高いエネルギーを消費したのです。研究者たちは、これはモデルが遅かったからではなく、内部で「思考」していたため、つまり、話す前に回答を計画するために「拡張推論(extended reasoning)」と呼ばれる手法を使用していたためだと考えています。これにより、最終的な出力が短くても余分なエネルギーが消費されるのです。このことは、質問全体に対する総エネルギーを見るだけでは誤解を招く可能性があることを浮き彫りにしています。真の効率性の指標は、各トークンを生成するためにどれだけのエネルギーがかかるかです。結局のところ、この論文は、自分のハードウェアでAIを動かすすべての人にとって、最もエネルギー効率の良い選択は、必ずしも最も強力なモデルや最大のモデルではなく、その仕事に適したアーキテクチャとサイズを持つモデルであるということを示唆しており、「時には、最も小さな脳が最も環境に優しい」ということを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →