← 最新の論文
🤖 machine learning

Prox: Training-Free FFN Activation Sparsity via Approximate Intermediate-Channel Salience in LLMs

Proxは、近似的な中間チャネルのサリエンシーからチャネルマスクを構築することにより、LLMにおける効率的なスパースSwiGLU FFNの実行を可能にし、再学習を必要とせずに既存の手法と比較して大幅な高速化と優れたモデル品質を実現する、トレーニングフリーのフレームワークである。

原著者: Jinyi Liu, Wei Chen, Pengyu Chen, Xinyi Yuan, Minghe Bai, Guoquan Wu, Jun Wei

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Jinyi Liu, Wei Chen, Pengyu Chen, Xinyi Yuan, Minghe Bai, Guoquan Wu, Jun Wei

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で超知能的なロボットの脳を、小型のバッテリー駆動デバイスで動かそうとしている場面を想像してみてください。この脳は「大規模言語モデル(LLM)」として知られ、物語を書いたり、数学の問題を解いたり、チャットをしたりすることに長けていますが、同時に非常に「食いしん坊」でもあります。文章の次の単語を考えるためだけに、膨大なメモリと処理能力を飲み込んでしまうのです。このロボットをより速く、かつ「喉の渇き(リソース消費)」を抑えるために、科学者たちは、重要ではない思考プロセスを「スキップ」することを教えようとしてきました。これは「活性化スパース性(activation sparsity)」と呼ばれます。これは、シェフがスープを作る際、キッチンにあるすべての野菜を刻むのではなく、味に加わる食材だけを素早く見極めて刻み、残りはそのままにしておくことに似ています。目標は、同じ美味しいスープ(正しい答え)を作りつつ、作業量を大幅に減らすことです。しかし、難しいのは、どの野菜をスキップすべきかを判断する際に、料理の決め手となる「秘密のスパイス」を誤って捨ててしまわないようにすることです。もし判断を誤れば、スープは味が薄くなったり、最悪の場合、食べられなくなったりしてしまいます。

このパズルに取り組んでいるのが、Jinyi Liu氏とそのチームによって開発された「Prox」と呼ばれる新しい手法です。彼らは、多くの強力なAIモデルの現在の標準である「SwiGLU」という特定のロボット脳のアーキテクチャに焦点を当てました。研究者たちは、脳の「中間の思考(中間状態)」が、何をスキップすべきかを決定するための完璧な地図を持っていることを発見しました。しかし、その地図を正確に計算することは、あまりにも遅く、コストがかかりすぎます。そこで、彼らは巧妙な2段階のトリックを考案しました。まず、脳の思考の「速くて質の低い下書き」を使用して、どの部分が重要かを素早く判断します。そして、ここが鍵となるのですが、その重要な部分に対してのみ、重厚で精密な数学的計算を行い、それ以外は完全に無視します。彼らの実験では、この手法は、事前のフル計算なしに重要性を推測しようとする従来のトリックよりもはるかに優れていることが示されました。10種類の異なるAIモデルを用いたテストにおいて、Proxは、賢さを維持したまま、ロボットの思考速度をほぼ倍増(最大1.99倍)させました。それは、先遣隊が道を素早く偵察して印を付け、本隊が迷うことなく安全で舗装された道だけを進めることで、時間とエネルギーを節約するようなものです。

問題点:ロボットの重たいランチ

大規模言語モデルは、知識の巨大な図書館のようなものですが、同時に非常に「重い」存在でもあります。質問に答えようとする際、メモリ内で膨大な量のデータを移動させなければなりません。このトラフィックの大きな部分は、脳の「フィードフォワード・ネットワーク(FFN)」と呼ばれる特定の部位から発生します。FFNは、アイデアを取り込み、処理して、次に渡していく脳のパーツだと考えてください。現代のモデルでは、この部分は「SwiGLU」という特別なレシピを使用しており、これには3つの異なる数学的操作(プロジェクション)が連携しています。

問題は、これら3つの操作があまりにも重いため、すべてを遅らせてしまうことです。科学者たちは、モデルを「スパース(疎)」にすることで、つまり、重要ではないと思われる脳のパーツの計算をスキップすることで、これを解決しようとしてきました。しかし、モデルを再学習(これには膨大な時間がかかります)させることなくこれを行う既存の手法には、欠陥があります。それらは、レシピの「ゲート」の部分だけを見たり、「アップ」の部分だけを見たりと、たった一つの情報に基づいて、どの部分をスキップするかを推測してしまうことが多いのです。これは、ドラムの音だけ、あるいはボーカルの音だけを聞いて、その曲が良いかどうかを判断しようとするようなものです。もし判断を誤れば、重要な音符をスキップしてしまい、曲(あるいはAIの回答)が崩壊してしまいます。

インサイト:地図 vs 旅路

Jinyi Liu氏率いる研究チームは、SwiGLUのレシピについて興味深いことに気づきました。プロセスの中に「中間状態(中間的な思考)」と呼ばれる特定の瞬間があります。この中間的な思考こそが、脳のどの部分を残し、どの部分をスキップするかを決定するための完璧なシグナルなのです。もしこの中間状態を正確に見ることができれば、作業の70%をスキップしても、完璧な答えを得ることができます。

しかし、ここに落とし穴があります。中間状態を正確に見るためには、まず重厚な計算をすべて完了させなければなりません。これは、レースのゴールラインを見ようとしているのに、そこに着くためにレース全体を走り切らなければならないようなものです。これでは、時間を節ดับするという目的が台無しになってしまいます。

チームは、中間状態の「正確な値」は必ずしも必要ではないことに気づきました。彼らに必要なのは、重要性の「順序」だけなのです。どのパーツが「大きい」のか、どのパーツが「小さい」のかを知る必要があります。それは、財布の中に正確に何ドル入っているかを知ることと、単にどの紙幣が一番高額かを知ることの違いのようなものです。順序さえ正しく推測できれば、残すべきものを正しく選ぶことができます。

解決策:Proxの2段階トリック

この問題を解決するために、チームは「スマートな偵察兵」と「精密な建築家」として機能する2段階のフレームワーク「Prox」を作成しました。

ステージ1:素早い偵察兵(プロキシの構築)
第1ステージでは、Proxは「安価な」バージョンの数学を使用します。入力データを取り込み、簡略化された低品質な脳(量子化された重み、つまり圧縮された小さな数値を使用)を通して実行します。完璧な答えを出そうとするのではなく、どのチャンネルが大きく、どのチャンネルが静かであるかという大まかなイメージを得ることを目的としています。このステージでは簡略化された計算を使用するため、非常に高速でメモリもほとんど消費しません。重要なのは、この粗い計算によるエラーが最終的な回答を台無しにすることはないという点です。なぜなら、これらの粗い数値は最終的な出力には決して使用されず、あくまで「リスト(目録)」を作成するためだけに利用されるからです。

ステージ2:精密な建築家(正確なスパース計算)
リストができたら、第2ステージが始まります。ここで本当の魔法が起こります。モデルはステージ1のリストを見て、「よし、作業の70%を無視して、上位30%の部分についてのみ計算を行う」と判断します。しかし、ここが他の手法との違いです。その上位30%に対して、Proxは元の、フル精度で重厚な数学的計算を使用します。重要な部分については正確な値を計算するのです。これにより、最終的な回答は、すべての作業を行った場合と同じ精度を保ちつつ、重要な部分に対してのみ作業を行うことが可能になります。

なぜより優れているのか

研究チームは、Qwen、Mistral、Llama-3といった10種類の異なる大規模言語モデルを用いてProxのテストを行いました。そして、再学習なしに作業をスキップしようとする他の手法と比較しました。

結果は明白でした。Proxの勝利です。高いレベルのスキップ(例えば70%のスパース性)において、他の手法はミスをし始め、AIの回答の質が低下しました。しかし、Proxは回答の鋭さを維持しました。実際、70%のスパース性において、Proxは標準的なグラフィックスカード上で、デコーディングプロセス(AIがテキストを生成する速度)を最大1.99倍高速化できました。これは、AIが賢さを失うことなく、ほぼ2倍速く会話できることを意味します。

また、チームは、数値を小さくする(量子化)ことや、アテンション・メカニズムの一部をスキップすることなど、他の高速化テクニックと組み合わせた場合に、この新しい手法が壊れないかどうかも確認しました。その結果、Proxはこれらの他の手法とも完璧に併用できることが分かりました。まるで、あらゆるセットアップに適合するユニバーサルアダプターのようです。

まとめ

論文は、ProxがAIを高速化するための強力で、再学習を必要としない方法であることを結論付けています。巨大なモデルを効率化するために、再学習をする必要はないということを証明しました。代わりに、巧妙な2段階のプロセスを使用できます。まず、速くて粗い推測を使って重要な部分を見つけ、次に、その部分に対してのみ重労働を行います。このアプローチは、他の手法が陥った「推測ゲーム」を回避し、小型デバイスで動かしていても、ロボットの脳が速さと賢さを維持できるようにします。現在のバージョンは、主にシングルユーザーの会話(スマートフォンでのチャットなど)に最適化されていますが、研究者たちは、さらなる改良を加えることで、このアイデアが将来的にさらに大規模なユーザーグループを効率的に運用することにも貢献できると考えています。現時点において、これはAIを、その知能を犠牲にすることなく高速化するための大きな一歩となっています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →