← 最新の論文
💬 NLP

SpenseGPT: Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference

SpenseGPTは、カスタムコンパイラのサポートを必要とせずに厳格な半構造化スパース性の制限を克服し、モデルの精度を維持しながらB200 GPU上で最大1.2倍のエンドツーエンドのLLMデコーディング高速化を実現する、ハイブリッドなスパース・デンス重みフォーマットを活用した実用的なワンショット・プルーニング手法を導入します。

原著者: Jaeseong Lee, Seung-won Hwang, Samyam Rajbhandari

公開日 2026-06-10
📖 1 分で読めます☕ さくっと読める

原著者: Jaeseong Lee, Seung-won Hwang, Samyam Rajbhandari

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたには、コンピュータにコードを書かせたり、数学の問題を解かせたり、指示に従わせたりすることができる、巨大で非常に賢い図書館(大規模言語モデル、またはLLM)があります。このライブラリを最新のコンピュータ上で高速に動作させるために、エンジニアたちは、より軽く、より速くするために不要な本を取り除く「プルーニング(枝刈り)」を行おうとしてきました。

しかし、そこには落とし穴があります。新しいコンピュータチップ(NVIDIAのB200など)でこれらの本を最も速く読むには、非常に厳格なルールが必要です。それは、「4冊の本に対して、必ず2冊は空欄でなければならない」というルールです。これは「2:4 スパース性(疎性)」と呼ばれます。

問題点:厳格なルール

問題は、この厳格なルールが、まるで「必ず半分は空けておかなければならない」という条件でスーツケースをパッキングしようとしているようなものだという点です。もし、ルールに従うためだけにランダムに本の半分を捨ててしまうと、重要な情報が失われ、ライブラリは正常に機能しなくなります。コンピュータは速くなりますが、その回答は馬鹿げたものや間違ったものになってしまいます。

他の研究者たちは、このルールをより柔軟にする方法を試みましたが、彼らの解決策は、特定の燃料でしか動かない特注の高級エンジンを構築するようなものでした。あるいは、追加の作業(オーバーヘッド)が多すぎて、スピードアップによる恩恵が消えてしまいました。

解決策:Spense(ハイブリッドな本棚)

この論文の著者たちは、Spenseと呼ばれる新しい手法を提案しています。ライブラリ全体に厳格な「2冊空けて、2冊埋める」というルールを強制するのではなく、棚を2つのゾーンに分割します。

  1. スパース・ゾーン(疎な領域): ここでは、厳格なルール(4冊中2冊の本を取り除く)に従います。このゾーンは、コンピュータの特別なハードウェアによるスピードアップの恩恵を受けます。
  2. デンス・ゾーン(密な領域): ここでは、すべての本を保持します。本は取り除かれません。このゾーンは、最も重要な情報を維持します。

これは、ハイブリッドカーのようなものです。「スパース・ゾーン」は電気モーター(巡航時に超効率的)であり、「デンス・ゾーン」はガソリンエンジン(坂道を登る時に強力)です。これらを組み合わせることで、パワーを失うことなく、スピードという両方の良いところ取りができるのです。

秘訣:何を残すかを選ぶこと

難しいのは、どの本を「デンス・ゾーン」に入れ、どの本を捨てるかを決めることです。この選択が極めて重要です。もし間違った本を残してしまうと、ライブラリは依然として失敗してしまいます。

著者たちは、この選択を行うために2つの戦略を開発しました。

  • SpenseGPT(シンプルな戦略): 本が一直線に並んでいると考えてみてください。この方法は、「棚にある本の最後の25%をそのまま(デンス)残し、最初の75%を削る(スパース)」と言います。この単純な「最後で切る」アプローチは、プルーニングの計算方法のおかげで、驚くほどうまく機能することが分かりました。
  • SpenseGPT+(スマートな戦略): これは、すべての本を読み、どれが最も重要かを判断する司書を雇うようなものです。最終的な答えに対して、それぞれの本がどれだけ貢献しているかに基づいて「スコア」を算出します。最もスコアの高い本をデンス・ゾーンに残すことで、最も重要な知識が決して失われないようにします。

結果:高速かつ正確

チームは、2つの非常に大規模で賢いモデル(Qwen3-32BおよびSeed-OSS-36B)を用い、最新の超高速コンピュータチップ(B200 GPU)を使用してテストを行いました。

  • 速度: 実用的な使用において1.2倍のスピードアップを達成しました。これは、コンピュータが以前よりも明らかに速く回答を生成できることを意味します。
  • 正確性: モデルを「馬鹿」にしてしまう他の手法とは異なり、Spenseはモデルの賢さを維持しました。数学的推論、コーディング、指示への追従といった困難なタスクにおいて、元の(プルーニングされていない)モデルと同等の性能を発揮しました。
  • 実用性: 決定的なことに、この手法は新しいカスタムコンピュータ・ソフトウェア(コンパイラ)を必要としません。これらのチップにすでに存在する、高度に最適化された標準的なツールで動作します。

まとめ

要約すると、この論文は、AIモデルを賢さを損なうことなく高速化する方法を紹介しています。モデル全体に「半分を空にする(これが壊れる原因になる)」ことを強いるのではなく、ハイブリッドなシステムを作り上げました。つまり、モデルの一部はスピードのために削ぎ落とし、最も重要な部分は正確さのために満たしておくのです。これにより、現代のコンピュータは、すでに利用可能なツールを使用して、これら巨大なAIの脳をかつてないほど速く動かすことができます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →