← 最新の論文
💻 computer science

LEAP: Learnable End-to-End Adaptive Pruning of Large Language Models

本論文は、大規模言語モデルにおける実用的な非構造化スパース性の学習を可能にするために、重みごとのベルヌーイ分布をガムベル・シグモイド緩和を用いて学習可能なエンドツーエンドの適応的プルーニング手法「LEAP」を導入し、高いスパース性レベルにおいてゼロショット精度で既存の層ごとのベースラインを大幅に凌駕することを示す。

原著者: Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがほぼすべてを知っている巨大で非常に賢い図書館(大規模言語モデル)を持っていると想像してください。しかし、この図書館はあまりにも巨大で、倉庫全体を占め、運転には巨大な発電所が必要であり、通常のコンピュータで実際に使用するには遅すぎます。

これを解決するために、モデルの「重み」または接続に相当する本の50%から60%を捨てて、より小さく高速にしたいと考えています。目標は、本の数が半分になっても、図書館が同じくらい賢いままになることです。

ここで論文LEAPが登場します。彼らがどのようにこの問題を解決したか、その物語を簡単に説明します。

問題:「選択肢が多すぎる」罠

長年、科学者たちは本の削減を試みる際に、主に2つの戦略を用いてきました。

  1. 「層ごとのアプローチ」(旧来の方法): 司書が棚を一つずつ見て、「この本は役に立たなさそうだ、捨てよう」と決定すると想像してください。彼らは他の棚と相談することなく、すべての棚に対してこれを繰り返します。

    • 欠点: 時には、単独の棚では役に立たなさそうに見える本が、実は図書館全体にわたる物語にとって決定的に重要である場合があります。棚を孤立して見ることで、この方法は重要な接続を誤って捨ててしまい、図書館の賢さを損なうことになります。
  2. 「パターン」アプローチ(最近の、壊れた方法): 最近、いくつかの研究チームは図書館全体を一度に見ようとしました。彼らは、「どの本を残すべきかを正確に学ぼう」と言いました。しかし、彼らは本を小さなセット(例えば4冊ずつ)にグループ化し、「これらの4冊のどのパターンを残すべきか?」と問うことでこれを行おうとしました。

    • 欠点: これは小さなグループにはうまく機能します。しかし、現代のAIモデルが持っているような4,000冊の本の列全体に対してこれを試みると、考えられる「パターン」の数が、書き留めることさえ不可能なほど巨大な数になってしまいます。10億枚のくじのすべての組み合わせをリストアップしようとするようなものです。コンピュータが詰まり、数学が破綻します。

解決策:LEAP(「個別の投票」システム)

この論文の著者であるLEAPは、数学に圧倒されずにどの本を残すかを投票するための新しい方法が必要だと気づきました。

「どのグループのパターンを残すか?」(巨大なグループには不可能)と問う代わりに、彼らはすべての単一の本に対してはるかに単純な質問をしました。「この特定の本は残すか、捨てるか?」

  • 比喩: 巨大な選挙を想像してください。すべての有権者(モデル内のすべての重み)が小さな投票用紙を受け取ります。複雑な「チーム戦略」に投票するのではなく、「はい(残す)」または「いいえ(捨てる)」と投票するだけです。
  • 魔法のトリック: これを機能させるために、彼らは「ガンベル・シグモイド」と呼ばれる数学的なトリックを用いました。これにより、コンピュータは最初は投票をスムーズに「推測」し、その後、すべての投票が明確な「はい」または「いいえ」になるまで、その推測を徐々に厳しく鋭くしていきます。

彼らがどのように行ったか(レシピ)

彼らはゼロから始めませんでした。彼らは賢い出発点を使用しました。

  1. ウォームスタート: まず、Wandaと呼ばれる迅速で単純な方法を用いて、どの本が役に立たない可能性が高いかの大まかな見解を得ました。コンピュータが盲目に推測する必要がないように、これを「先行点」として使用しました。
  2. トレーニング: 彼らはコンピュータに、少量のテキスト(較正ストリーム)を読み、図書館の知性を高く保つように「はい/いいえ」の投票を調整させることで、最適な投票セットを「学習」させました。
  3. 本の固定: 重要なのは、彼らは本の中の言葉(モデルの重み)を変更しなかったことです。彼らが変更したのは、どの本を残すかの決定だけでした。これにより、図書館の元の「個性」と知識はそのまま保たれ、単にパッケージが小さくなるだけです。

結果:より賢く、より速く、より軽快に

彼らは、小型から超大型まで多様な5つの有名なAIモデルでこれをテストし、それらを50%および60%削減しました。

  • スコアカード: 彼らはLEAPを既存の最良の方法と比較しました。
  • 勝利: LEAPは一貫して優れていました。平均して、以前の最良の方法よりもモデルの精度を2.59ポイント向上させました。場合によっては、改善幅が5.40ポイントに達しました。
  • 速度: 彼らはこの作業に特化した新しい高速コンピュータチップ(GPU)に完全に適合する形でモデルを削減したため、結果として得られたモデルは、賢さを失うことなくはるかに高速に動作します。

なぜこれが重要なのか

以前は、巨大なAIモデルを小さく、高速にしたい場合、以下の間で選択を迫られていました。

  • 選択肢A: 正確だが、巨大で遅いままにする。
  • 選択肢B: 小さく速くするが、愚かにする。

LEAPは、両方の利点を享受できることを示しています。これにより、これらの巨大なAIの脳を半分まで縮小し、同じくらい賢いままに保つ実用的な方法が提供され、スーパーコンピュータではなく通常のコンピュータで実行できるようになります。

要約すると: LEAPは、すべての接続が自分自身を残すべきかどうかを投票させることで、巨大なAIモデルを編集する新しい、より賢い方法であり、より小さく、より速く、そして依然として非常に知的なAIをもたらします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →