← 最新の論文
🤖 machine learning

Accelerating GPU Inference of Large Language Models with Moderately Unstructured Sparse Weight Matrices

本論文は、現代のGPU上で中程度の非構造化疎なLLM推論を可能にするために、スパースコアとCUDAコアを共同で活用する新しい3層行列ストレージフォーマットとハイブリッドSpMMカーネルを提案しており、密行列乗算に対する初のカーネルレベルの高速化を実現し、SpInferやFlashLLMといった最先端の手法を凌駕している。

原著者: Tao Lu, Haoyu Wang, Zonghui Wang, Keshen Xiang, Jiaheng Zhang, Wenzhi Chen

公開日 2026-07-13
📖 1 分で読めます☕ さくっと読める

原著者: Tao Lu, Haoyu Wang, Zonghui Wang, Keshen Xiang, Jiaheng Zhang, Wenzhi Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

膨大な数の本(大規模言語モデル)を持つ巨大な図書館を想像してみてください。その本は物語を書いたり、質問に答えたり、コードを書いたりすることができます。これらの本を機能させるためには、超高速なロボット(GPU)が、次の単語を見つけ出すために、何百万もの数字のページ(重み)を読み進めなければなりません。問題は、ロボットが読み込みに忙しすぎて、疲れ果ててしまい、実行コストも高くなってしまうことです。

科学者たちは、賢いトリックを試みました。それは、退屈で重要ではないページを捨てて、図書館を軽くすることです。これは「プルーニング(枝刈り)」と呼ばれます。しかし、ここには落とし穴があります。もしページを捨てすぎてしまうと、物語が奇妙になり、意味をなさなくなってしまいます。理想的なのは、ページの約半分を残すこと(5 sparsity 50%)です。

大きな問題
図書館が軽くなれば、読むのが速くなると思うでしょう?しかし、そうとは限りません。ロボットの読み取り機(GPU)は、密度が高く、欠けのないページを非常に素早く読むように作られています。ページが散らばっていたり、欠けがあったりする場合(非構造化スパース性)、ロボットは混乱してしまいます。欠けているページを探したり、破片を整理したりすることに時間を費やしすぎるため、実際には重くて中身の詰まった図書館を読むよりも遅くなってしまうのです。この「散らばった」読み取りのための既存のツールは、動作が遅すぎるか、あるいはロボットに追加の計算を強いることになり、その結果、スピードアップの効果が相殺されてしまいました。

新しい解決策:3層のファイリングシステム
著者たちは、ロボットがこれらの散らばったページを効率的に読めるように、全く新しいファイリングシステムを構築しました。彼らはこれを「3層」形式と呼び、超整理された司書のように機能します。

  1. 「Sparse-TC」層(VIPセクション): 司書はまず、整然とした、あらかじめ承認されたパターン(例:4ページごとに2つの重要なメモがあるなど)に適合するページを掴みます。これらは、ロボットの最も速い専用の読み取りアーム(Sparse Tensor Cores)へ直接送られます。探索の必要はありません!
  2. 「スロット充填」層(パズルのピース): では、VIPのパターンに適合しなかった余分なメモはどうなるのでしょうか?それらを捨てたり、乱雑なリストにしたりする代わりに、司書はVIPのページの空いた隙間にそれらを押し込みます。膨大な住所録を書かずに、これらがどこに行ったかを追跡するために、「並列差分距離(Parallel Differential Distance)」コードを使用します。これは、「次の手がかりは右に3ステップ」とだけ記された宝の地図のようなものです。毎回フルアドレスを書き記す代わりに、これを用いることで、スペースを節約し、素早くデコードできます。
  3. 「残差(Residual)」層(ゴミ箱): 非常にわずかな(1%未満の)メモの中には、どこにも適合しない奇妙なものがあります。これらは、標準的な旧式のファイリングキャビネット(CSR形式)に送られます。数が極めて少ないため、ロボットはこれをチェックすることを厭いません。

スーパー・パイプライン
真の魔法は、ファイリングシステムそのものだけでなく、ロボットが読みながらどのように動くかにあります。著者たちは、ロボットが以下の3つのことを同時に行うワークフローを設計しました。

  • メモリ棚(グローバルメモリ)から次のページの塊を掴む。
  • 「右に3ステップ」という宝の地図の手がかりをデコードする(標準コアを使用)。
  • VIPページの数字を計算する(高速な専用コアを使用)。

これらのタスクをオーバーラップさせることで、ロボットがデータ待ちでアイドル状態になることがなくなります。これは、シェフが一度に一つのことを行うのではなく、野菜を切り、鍋をかき混ぜ、テーブルをセットするという作業を同時にこなすようなものです。

結果:以前よりも高速に
彼らが現代の高速ロボット(メモリ80GBを搭載したNVIDIA H100 GPU)でテストしたところ、結果は驚くべきものでした。

  • 速度: 彼らの手法は、カーネルレベルにおいて、重くて中身の詰まった図書館を読む速度を実際に上回った最初の手法となりました。従来の最高ツール(SpInfer)よりも最大1.64倍速く動作しました。
  • エンドツーエンド: テキスト生成のプロセス全体では、FlashLLMよりも最大1.41倍速くなりました。
  • メモリ: また、中身の詰まった図書館を読む場合と比較して、メモリ容量を約**21.4%**節約しました。

できないこと
著者たちは、これが何ではないかを明確に述べています。この手法は、図書館がほとんど空に近い場合(90%以上の高いスパース性)には最適ではありません。そのような場合は、従来の方法の方が優れています。また、これは「デコード」フェーズ(ロボットが一度に一単語ずつ書き出す段階)に最適化されています。ロボットが一度に巨大なテキストのブロックを読み込む場合(「プリフィル」フェーズ)、この新しい手法は標準的な重い読み取りツールよりもわずかに遅くなる可能性がありますが、これは現在彼らが解決しようとしている特定のシナリオではありません。

要約すると、散らばったページをスマートな3層システムに整理し、ロボットを常に忙しく働かせることで、彼らはAIチャットボットを賢くすることなく、より速く、より安価に実行できるようにしたのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →