← 最新の論文
🤖 machine learning

Compressing LLMs with MoP: Mixture of Pruners

本論文は、深さと幅のプルーニングを統合する反復的なフレームワークであるMoP(Mixture of Pruners)を紹介しており、これはLLaMAおよびLLaVAモデルにおいて、既存の単一次元の手法を上回る精度向上とレイテンシ削減を実現するものである。

原著者: Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jorda
公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jordao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大で重い図書室をバックパックに入れて運ぼうとしているところだと想像してみてください。この図書室には人類の知識の総和が収められており、最も賢いコンピュータにしか読めないほど複雑な言語で書かれています。これらの「図書室」は、大規模言語モデル(LLM)と呼ばれています。それらは物語を書いたり、数学の問題を解いたり、友人のようにチャットしたりすることに長けています。しかし、一つ問題があります。それらはあまりにも巨大で重いため、たった一文を読むためだけに、膨大な量の電気と超高速のコンピュータを必要とするのです。もしこれらを一般的なノートパソコンやスマートフォンで使おうとすると、動作が非常に遅くなったり、重すぎて扱えなくなったりすることがよくあります。

これを解決するために、科学者たちは、重要な本を捨て去ることなく、これらの図書室をより小さくする方法を模索してきました。一つの方法は「プルーニング(枝打ち)」と呼ばれるものです。プルーニングをガーデニング(庭仕事)のように考えてみてください。あなたには巨大で生い茂った茂み(大きなコンピュータモデル)があり、それを整った小さな形にしたいと考えています。あなたは、枝ごと切り落とす(茂みを短くする)こともできますし、枝から葉を刈り取って枝を細くすることもできます(枝を細くする)。長い間、庭師たちは、枝ごと切り落とすか、あるいは枝の葉を刈り取るかのどちらか一方を選ばなければなりませんでした。問題は、茂みの健康を保ち、かつ実を結ぶ能力を維持したまま、どのようにして茂みを小さくするかということでした。

この論文では、「MoP」と呼ばれる新しいガーデニングツールを紹介しています。これは「Mixture of Pruner(混合プルーナー)」の略です。単に一つの方法を選んでトリミングするのではなく、MoPは両方の方法をあらゆるステップで試みる、賢い反復型の庭師です。あなたが茂みを整えている場面を想像してください。各カットにおいて、MoPは二つの質問を投げかけます。「もしこの枝を丸ごと切り落としたら、茂みはどう見えるか?」そして「代わりに、この枝から葉だけを刈り取ったら、どう見えるか?」と。そして、元の健康的だった植物に最も近い状態を維持できる方を選択します。このように、枝を切ることと葉を刈り取ることを交互に繰り返しながら、茂みがあなたのバックパックに収まるサイズになるまでプロセスを続けます。

研究者たちは、LLaMA-2やLLaMA-3といった世界で最も賢いコンピュータの脳を用いて、この手法をテストしました。その結果、MoPは単一の手法を用いるよりも、これらのモデルを縮小させる上で非常に優れていることが分かりました。モデルを40%削減(40%小型化)した際、MoPは競合する手法と同等の賢さを維持したまま、回答速度を大幅に向上させました。実際、モデルの回答速度は39%速くなりました。さらに驚くべきことに、彼らは画像とテキストの両方を理解できるモデル(LLaVA-1.5と呼ばれます)でもテストを行いました。その結果、トリミングされたモデルにはテキスト(画像なし)のみを「教えた」にもかかわらず、そのモデルは以前とほぼ変わらない精度で画像を理解できることが判明しました。このことは、二つのトリミング戦略を組み合わせることで、モデルが非常に小さくなっても道を見失うことなく、より小さく、より速く、より賢いコンピュータの脳を作り出せることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →