← 最新の論文
🤖 machine learning

PATCH: Learnable Tile-level Hybrid Sparsity for LLMs

PATCH は、LLM の重み行列を学習可能な密または 2:4 疎な割り当てを持つタイルに分割するハイブリッド疎性フレームワークであり、既存の非構造化または硬直的な半構造化プルーニング手法と比較して、0% から 50% の間の連続的な疎性比率を実現し、優れた精度と実用的な GPU 速度向上を達成します。

原著者: Younes Hourri, Mohammad Mozaffari, Maryam Mehri Dehnavi

公開日 2026-04-30
📖 1 分で読めます☕ さくっと読める

原著者: Younes Hourri, Mohammad Mozaffari, Maryam Mehri Dehnavi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(LLM)を、数十億冊の書物(パラメータ)を収蔵する巨大で超整理された図書館として想像してみてください。この図書館を標準的なコンピュータ上で高速に動作させるためには、いくつかの書物を除去する必要があります。しかし、あなたは厄介なジレンマに直面します。

  1. 「無秩序」なアプローチ(構造化されていないスパース性): 棚のどこからでもランダムに書物を捨てます。これにより、非常に選択的であるため図書館の知識は極めて正確に保たれますが、混沌とした散らかりが生じます。書物を探す司書(コンピュータの GPU)はあちこちに飛び回らなければならず、プロセスは遅く非効率になります。
  2. 「硬直」なアプローチ(2:4 スパース性): 「4 冊のグループごとに、正確に 2 冊を除去しなければならない」という厳格なルールに従うことにします。これによりパターンが予測可能になるため、司書の作業は容易かつ高速になります。しかし、このルールは硬直しすぎています。時として、除去しなければならない 2 冊が実は最も重要な書物であることがあり、それによって図書館の知性と正確性が失われることになります。

登場:PATCH — 「スマートなタイル」司書

この論文は、PATCH(ハイブリッドスパース性のための学習可能なタイルレベル設定によるプルーニング)と呼ばれる新しい手法を紹介しています。PATCH は、「無秩序」なアプローチと「硬直」なアプローチのどちらかを選ぶのではなく、図書館をタイル(管理しやすい棚の小さな区画)に分割するスマートな司書のように機能します。

以下は、簡単な比喩を用いたその仕組みです。

  • タイルシステム: 図書館がモザイクのような正方形のタイルに分割されていると想像してください。
  • 決定: 各タイルについて、PATCH システムは選択を行うように学習します。
    • オプション A(高密度): このタイルを完全に書物で満たしたままにします。これは、正確性が最も重要な図書館の「重要」なセクション向けです。
    • オプション B(2:4 スパース): このタイルに「4 冊から 2 冊を除去する」という厳格なルールを適用します。これは、図書館に安全に除去してスペースを節約し、速度を向上させることができる余分で冗長な書物があるセクション向けです。
  • 学習プロセス: システムは推測しません。どのタイルを高密度にし、どのタイルをスパースにするべきかを正確に把握するために自ら「訓練」します。重要部分は高密度に保ち、冗長部分はスパースに保ちながら、ハードウェアに優しいルールに従うように学習します。

これがなぜ画期的なのか?

  • 両者の長所: PATCH はそのギャップを埋めます。図書館の正確性を保ちつつ(「無秩序」なアプローチのように)、コンピュータが素早く読み取れるように整理します(「硬直」なアプローチのように)。
  • 柔軟な速度: 「図書館を 25% 小さくしたい」あるいは「50% 小さくしたい」と PATCH に指示できます。固定された 50% 削減に縛られるのではなく、「高密度タイル」と「スパースタイル」の数を調整して、その目標を完璧に達成します。
  • 実世界での結果: 著者らは、小規模から非常に大規模(最大 130 億パラメータ)までのモデルでこれをテストしました。
    • 速度: 標準的なコンシューマー向けグラフィックカード(A6000 GPU)上では、PATCH は元のプルーニングされていないモデルと比較して、モデルを1.18 倍から 1.38 倍高速に実行しました。
    • 賢さ: 速度を上げる際にモデルを「愚か」にしてしまう他の手法とは異なり、PATCH は現在の最先端の硬直手法(MaskLLM)と比較して、モデルをより正確にしました(0.37% から 2.96% の向上)。

まとめ

PATCH を巨大な倉庫の整理整頓方法だと考えてください。ランダムに物を捨ててフォークリフトの動きを遅くしたり、重要な品物を捨ててしまう愚かなルールに従ったりするのではなく、PATCH はフォークリフトが好むパターンで、特定のゾーンを満杯に保ち、他のゾーンを整理することを知的に指定します。その結果、移動が速く、かつすべての重要な知識を保持した倉庫が実現します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →