← 最新の論文
💬 NLP

WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

本論文は、アテンションヘッドおよびFFNチャネルのきめ細かな選択を可能にすることでLLMのトークンレベルの動的な幅のプルーニングを実現する、初のエンドツーエンドで微分可能なフレームワークであるWIDEを紹介しており、専用のカーネル・コデザインと組み合わせることで、高い精度を維持しながら大幅なエンドツーエンドの推論加速を実現している。

原著者: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大で非常に賢いロボットの脳を、小さなバッテリー駆動のデバイスで動かそうとしていると想像してください。このロボットの脳は、大規模言語モデル(LLM)と呼ばれる人工知能の一種です。物語を書いたり、数学の問題を解いたり、人間のようにチャットしたりすることができます。しかし、問題は、これらの脳は非常に巨大であるということです。これらはあまりに大きく、電力も大量に消費するため、通常はスーパーコンピュータを使って動かす必要があります。そのため、スマートフォンやノートパソコンで使うには、動作が遅く、コストも高くついてしまいます。

これを解決するために、科学者たちはこれらの脳を「プルーニング(枝刈り)」しようとしてきました。プルーニングとは、巨大で茂りすぎた生け垣を整えるようなものです。植物がほとんど機能していない枝を切り落として、小さく、速くします。長い間、この最も良い方法は、植物がその日に何をしようとしているかにかかわらず、生け垣のセクション全体を永久に切り落とすことでした。しかし、これは少し不器用な方法です。時として、特定のタスクに必要だった枝まで切り落としてしまい、ロボットを物忘れさせてしまうことがあるからです。最近では、ロボットが思考している最中に、どの部分を使うかを判断できる、よりスマートな方法が発明されました。しかし、これらのスマートな手法でもまだ少し粗削りでした。彼らは、あるセクション全体を使うか、あるいは完全にスキップするかという決定を下しており、それはまるで、いくつかの特定の明かりだけをつけるのではなく、部屋全体を使うか、あるいは家全体を空っぽにするかを決めるようなものでした。

この論文では、WIDE(Width-based Inference with Dynamic Execution:幅に基づいた動的実行による推論)と呼ばれる新しいシステムを紹介しています。これは、ロボットに、脳内のあらゆる電球に対して超精密な調光器を与えるようなものです。部屋全体をオンにするかオフにするのではなく、WIDEは、単語(トークン)を処理するごとに、どの小さなニューロンのグループ(脳の細胞)を点灯させ、どれを消したままにするかを、動的に決定することができます。研究者たちは、この瞬時の判断を下すための特別な「交通管制官」(ルーター)を構築しました。また、コンピュータのハードウェアが混乱したり速度が低下したりすることなく、これらの決定を処理できる新しい方法も設計しました。その結果、ロボットは以前と同じくらい賢いまま、脳の容量の半分を削り取ったとしても、より速く、より少ないエネルギーで動作するようになりました。

問題点:「全か無か」の罠

あなたが、大規模なキッチンを運営しているシェフだと想像してください。あなたには、料理を作るために協力し合う何百人ものシェフ(ニューロン)がいます。昔は、時間を節約したい場合、キッチンのスタッフの半分を永久に解雇していました。これは、常に同じ簡単な料理を作っている場合にはうまく機能しますが、もし突然、複雑なケーキを焼く必要が出てきたら、必要だった唯一のパン職人を解雇してしまったかもしれません。これが**静的プルーニング(static pruning)**で起こることです。モデルは、どのような質問に答えているかにかかわらず、一度切り取られ、固定されます。

その後、**動的プルーニング(dynamic pruning)**が登場しました。これは、マネージャーを雇って、「おい、今回の注文にはグリル・ステーションだけでいいぞ。ベーカリーは休憩していい」と伝えるようなものでした。これは改善されましたが、マネージャーはまだ少し不器用でした。彼らは、「ベーカリー全体をスキップしろ」と言ってしまうのです。たとえ、そのベーカリーに10個のオーブンのうち2個だけが必要だったとしてもです。これは、キッチンの大きな塊に対する「全か無か」の決定でした。

問題は、現代のAIモデルは非常に複雑であるため、塊全体をスキップすると、有用な情報が失われ、回答の質を損なってしまうことが多いということです。さらに、もしマネージャーが毎秒ごとにスケジュールを変更し続けると、キッチンのスタッフは混乱し、切り替えのオーバーヘッドのせいで、実際の調理速度はあまり速くなりません。

解決策:WIDEの「調光器」

Ningbo Institute of Digital TwinとLMU Munichで働くこの論文の著者たちは、WIDEを生み出しました。部門全体を解雇したり、部屋全体をスキップしたりする代わりに、WIDEは、モデルが単語(トークン)を処理するごとに、どの小さなニューロンのグループを活性化させるかを決定することを可能にします。

モデルの脳を、巨大な照明スイッチのグリッドだと考えてください。

  • 従来の動的方法: 「家の左翼全体を消灯せよ」
  • WIDE: 「この特定の単語に対しては、キッチン、しかもコンロと冷蔵庫の上にある照明だけを点けて。それ以外のキッチンは暗いままにしておけ」

WIDEは、モデルに付随する軽量な「ルーター」(小さな意思決定者)を使用することでこれを行います。このルーターは現在の単語を見て、「このアテンション・ヘッド(他の単語を見る部分)のグループが必要か?」そして「このFFNチャンネル(意味を処理する部分)のグループが必要か?」と問いかけます。そして、そのグループを使うか、スキップするかというバイナリ(二値)の選択を行います。

決定的なことに、WIDEは単に決定を下すだけでなく、ハードウェアの悩みを解決します。通常、コンピュータに計算のランダムな部分をスキップするように指示すると、コンピュータはデータの所在を探すことで停滞してしまいます。WIDEは、**マスク再配置(mask reordering)**と呼ばれる巧妙なトリックを使用します。郵便物の乱雑な山があり、いくつかは配達用で、いくつかはゴミだと想像してください。ゴミを捨ててから郵便物を仕分けようとする代わりに、WIDEはまず、すべての「保持すべき」手紙を整然としたブロックとして上に、すべての「ゴミ」の手紙を下に、山をシャッフルします。これにより、コンピュータはすべての郵便物を一つずつチェックすることなく、非常に効率的に「保持すべき」ブロックを処理できるようになります。

実験結果:スピードと賢さ

研究者たちは、Llama 3.1(80億パラメータ)やLlama 3.2(30億パラメータ)といった普及しているAIモデルを用いてWIDEをテストしました。彼らは、静的および動的プルーニングにおける既存の最高の方法と比較しました。

数値が示唆する内容は以下の通りです:

  • よりスマートなプルーニング: モデルの容量を50%削減(非常に積極的なトリミング)した際、WIDEは他のどの手法よりもモデルの知能をよく維持しました。例えば、Llama 3.1モデルにおいて、WIDEはプルーニング後に元の精度の**86.42%を維持しましたが、次に優れた動的方法であるSkipGPTは59.42%**しか維持できませんでした。追加のファインチューニングなしでも、WIDEはすでに最高の静的方法を上回っていました。
  • 現実世界のスピード: 論文では、モデルが実際にどれほど速くなったかを測定しています。「プリフィル(prefill)」段階(長いプロンプトを読み込む段階)では、WIDEは元のモデルよりも1.68倍速くなりました。「デコード(decode)」段階(答えを単語ごとに生成する段階)では、1.55倍速くなりました。
  • カーネルレベルのマジック: 数学的な計算のみに注目すると(他のオーバーヘッドを無視すると)、スピードアップはさらに劇的で、プリフィルで最大1.98倍、デコードで最大4.95倍に達しました。これは、従来のメソッドが「スキップ」を扱う際の非効率な方法がボトルネックであったことを示唆しており、WIDEの新しいハードウェア設計がそれを解決したことを意味しています。

また、著者らはモデルが非常に戦略的に学習したことも発見しました。モデルは単にランダムに部分をスキップしたのではなく、「the」や「a」のような「退屈な」単語をスキップし、「running」や「track」のような「重要な」単語を保持することを学習しました。あるテストでは、モデルはアテンションの作業の66%をスキップしましたが、プロセッシング(処理)の作業は28%しかスキップしておらず、どこでエネルギーを節約すべきかを正確に把握していたことが示されました。

結論

WIDEは、効率的なAIの未来が、単にモデルを小さくすることではなく、残された部分を「どのように」使うかについてモデルをより賢くすることにあることを示唆しています。「部屋全体をスキップする」から「特定の明かりを調光する」へと移行し、さらにこれらの調光器を効率的に扱うためにキッチンを再設計することで、著者らは強力なAIモデルを、記憶力を失うことなく大幅に高速化し、効率化するフレームワークを作り上げました。

結果は有望ですが、論文では、これはGPUハードウェア(コンピュータ内のチップ)向けの特定的なソリューションであり、モデルがまず意思決定を学び、次に失われた精度を取り戻すために素早い調整を受けるという、2段階のトレーニングプロセスに依存していることも記されています。これは、強力なAIを日常的なデバイスで利用可能にするための重要な一歩であり、賢くなるために巨大な脳は必要ではなく、ただ適切な時に脳のどの部分を使うかを知っていればよいということを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →