GLASS: Global-Local Aggregation for Inference-time Sparsification of LLMs
GLASS は、ランク集約を介して局所的なプロンプト固有の活性化と大規模言語モデルの内在的な事前分布を統合することで推論時のスパース化を改善するトレーニング不要のフレームワークであり、これにより動的な FFN プルーニングを安定化し、特に短いプロンプトによる長文生成のシナリオにおいて生成忠実度とデコード速度を大幅に向上させる。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが、物語を書き、質問に答え、問題を解決できる巨大で極めて賢い図書館(大規模言語モデル、または LLM)を持っていると想像してください。しかし、この図書館はあまりにも巨大で、あなたのスマートフォンやノートパソコンには収まりきりません。重すぎて、遅く、実行するにはエネルギーを必要としすぎます。
これをあなたのデバイスで動作させるためには、それを「剪定」する必要があります。つまり、思考中に内部のニューロン(脳細胞)の 50% を無視するよう指示し、実行速度を上げ、メモリ使用量を削減するのです。
問題:短いプロンプトにおける「推測ゲーム」
既存の手法は、あなたが最初に入力したもの(「プロンプト」)を見て、どの脳細胞を維持するかを決定しようとします。「さて、あなたは短い質問をしましたね。では、これらの特定のニューロンをアクティブに保ちましょう」と言うのです。
この論文は、これを「玄関から一歩踏み出した最初のステップだけで、旅行全体を計画しようとするようなもの」と主張しています。
- 短いプロンプト: 短い質問をすれば、モデルはこれから生成しようとしている長い回答にとってどのニューロンが実際に重要かを知るのに十分な情報を持っていません。
- 長い回答: モデルが長い物語の書き始めると、ニューロンの「重要性」は変化します。短い質問には重要に見えたものが、物語の残りの部分には役に立たないかもしれません。
- 結果: モデルは混乱し、間違いを犯し、間違ったニューロンを維持し、正しいニューロンをオフにしてしまったため、文章の質が低下します。
解決策:GLASS(グローバル・ローカル集約)
著者たちは、GLASS という新しい手法を提案しています。GLASS を、単一の情報源ではなく、2 つの異なる情報源を使って意思決定を行う賢いマネージャーだと考えてください。
- ローカルビュー(「今」のシグナル): これはあなたが今入力したものを観察します。「この特定の質問に基づいて、今どのニューロンが点灯していますか?」と問いかけます。これは文脈には適していますが、短い質問には信頼性が低いです。
- グローバルビュー(「本質的」なシグナル): これがこの論文の大きな革新です。モデルがあなたの質問を見る前に、研究者たちはモデルに空のプロンプト(単なる空白)を使って自分自身と対話させる特別なテストを行いました。「このモデルは、何があっても 常に どのニューロンを使用しますか?」と問うのです。これにより、モデルの最も重要で信頼性の高い脳細胞の「カンニングペーパー」が作成されます。
GLASS の仕組み:「ランキング」の比喩
GLASS は、どちらか一方を選ぶだけではありません。これはランク集約と呼ばれる巧妙な投票システムを使用します。
スポーツの試合のためにチームを選ぶと想像してください。
- ローカルコーチは言います。「選手 A は この 特定の試合には素晴らしいです。」
- グローバルコーチは言います。「選手 A は、これまでのキャリア全体に基づけば、私たちが持つ最高の選手です。」
ローカルコーチの言うことだけを聞けば、一つのプレーには良いが試合全体には悪い選手を選んでしまうかもしれません。グローバルコーチの言うことだけを聞けば、特定の戦略には合わないスター選手を選んでしまうかもしれません。
GLASS は両方を組み合わせます。 「ローカル」リストと「グローバル」リストを取り、それらを統合します。もしあるニューロンが 両方 のコーチから高く評価されれば、それは間違いなく残ります。もし一方のコーチが確信を持てない場合(プロンプトが短い場合など)、もう一方のコーチの意見が事態を救います。
「ヌルプロンプト刺激(NPS)」のトリック
膨大な書籍やウィキペディア記事のデータセットを必要とせずに、その「グローバル」なカンニングペーパーを取得するために、著者たちはヌルプロンプト刺激と呼ばれるトリックを使用しました。
- モデルに読むための本を与える代わりに、何もない状態(「ヌル」プロンプト)からテキストを生成させました。
- これにより、モデルは完全に自身の内部配線に依存することを強いられます。まるで、楽譜なしでスケールを演奏するように音楽家に頼み、どの指が自然に最も使われるかを見るようなものです。これにより、モデルの最も重要なニューロンの純粋で偏りのないマップが得られます。
結果:より速く、より賢く
この論文は、Llama、Gemma、Mistral など多くの異なるモデルで GLASS をテストし、以下を発見しました。
- より良い品質: 短いプロンプトから長い物語を書くよう求められた場合、GLASS は従来の手法よりもはるかに少ない間違いを犯しました。それは、剪定前の完全なモデルの品質に非常に近いものでした。
- より速い速度: 高機能なスマートフォンである Samsung Galaxy S25 Ultra において、GLASS は場合によってはモデルを最大11 倍高速に動作させました。これは、モデルがスマートフォンの高速メモリに完全に収まるほど小さくなったため、データを絶えず入れ替える遅いプロセスを回避できたからです。
要約
GLASS は、大規模な AI モデルを小型デバイスで動作させるための「プラグ-andプレイ」ツールです。モデルが 今 何をしているかと、モデルが 本能的に 得意としていることを組み合わせることで、短い質問における「誤った推測」の問題を修正し、AI が限られたリソースで作業している場合でも、賢く、高速であることを保証します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。