← 最新の論文
🤖 machine learning

Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference

本論文は、モデルの重みを変更することなく、行列積の有益なスライスを選択的に保持することで、Transformerベースのモデルにおける計算コストを削減し、様々なモデルサイズ、タスク、およびモダリティにわたってスケーラブルな精度と効率のトレードオフを実現する、学習を必要としない入力適応型の推論手法であるReduced Matrix Multiplication(RMM)を提案する。

原著者: Zixuan Lan, Yanhong Li, Jiawei Zhou

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Zixuan Lan, Yanhong Li, Jiawei Zhou

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代のコンピュータの脳を、巨大で超知的な司書に例えてみましょう。この司書はただ本を読むだけでなく、本を書き、数学の問題を解き、さらには絵を見て物語を語ることさえできます。これを行うために、この司書は「トランスフォーマー(Transformer)」と呼ばれる特別な種類の脳の構造を使用しています。トランスフォーマーを、情報が組み立てラインのように流れる巨大な工場だと考えてみてください。これらのライン上の各ステーションでは、工場は膨大な計算を実行します。それは、巨大な数字のグリッド同士を掛け合わせる作業です。これらが、魔法の原動力となる「行列演算(matrix multiplications)」です。問題は、これらの計算が非常に重たいことです。それは、ティースプーンを使って砂の山を動かそうとするようなもので、膨大なエネルギーと時間を必要とします。AIモデルが賢くなり、大きくなるにつれて、この「山」は高くなり、実行するためのコストと時間が膨れ上がっていきます。科学者たちは長い間、こう疑問に思ってきました。「司書は、あらゆるタスクに対して、本当にその砂山のすべての粒を使っているのだろうか? それとも、司書に気づかれることなく、取り除くことができる不要な砂がたくさんあるのではないだろうか?」

この論文は、「削減行列演算(Reduced Matrix Multiplication: RMM)」と呼ばれる巧妙な新しいトリックを紹介しています。工場を恒久的に縮小したり、司書の記憶の一部を削除したりする(それは故障の原因になります)代わりに、RMMはスマートな、その場限りのフィルターとして機能します。司書が膨大な計算を行おうとするたびに、RMMは一時停止してこう問いかけます。「今、このグリッドの中で、実際に重労働を担っている具体的な数字はどれだろうか?」そして、最も重要な数字だけ、例えば上位50%や70%だけを選び出し、その特定の瞬間については残りの数字を無視します。それは、シェフがスープを作るために冷蔵庫にあるすべての野菜を刻むのではなく、素早く出汁の味を見て、今まさに「この」味のために必要なニンジンと玉ねぎだけを使うことに似ています。最も素晴らしい点は、司書がこの方法を行うために再学習されたり教えられたりする必要はなく、すでに生成されている数字を用いて自然に機能するという点です。

研究者たちは、10億パラメータを持つ小さなモデルから700億パラメータを持つ巨人まで、幅広いAIモデルを用いてこのアイデアをテストしました。彼らは、これらのモデルが驚くほど柔軟であることを発見しました。数字の一部だけを残して計算量を減らしても、モデルが崩壊することはありませんでした。実際、モデルが大きければ大きいほど、正気を保ったまま手放せる「砂」は多いようでした。例えば、700億パラメータを持つ巨大なモデルは、計算量を50%削減しても、以前とほとんど変わらない精度で質問に答えたり物語を書いたりすることができました。しかし、この論文は、これらの工場がどのように構築されているかについての面白い奇妙な性質も発見しました。「アテンション(attention)」の部分(モデルがどこに集中すべきかを決定する部分)は非常に寛容で、仕事の半分を失っても容易に耐えることができます。しかし、「MLP」の部分(情報を処理し、変換する部分)はもっと敏感です。ここで削りすぎると、モデルはつまずき始めます。

チームはまた、このトリックがテキスト専用のモデルだけでなく、見て話すことができるモデルにも機能することを示しました。彼らはさらに、これらの数字をスキップすることが、特にストーリーや文章が非常に長くなる場合に、現実のコンピュータ上で実際に動作を速くすることを証明するための特別なソフトウェアツールも構築しました。この論文は、これがAIをより安価で高速にする有望な方法であることを示唆していますが、誰にとっても「完璧な」設定が一つ存在するわけではないことも指摘しています。モデルや、何をさせているかに基づいて、どれくらい削るかを調整する必要があります。しかし全体として、RMMは、トレーニング不要でデジタルな巨人をより軽く動かすための新しい方法を提供しており、時には、計算を少なくすることが、実は同じくらい明晰に思考する助けになることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →