✨ 要約🔬 技術概要
あなたは、巨大で重い図書室をバックパックに入れて運ぼうとしているところだと想像してみてください。この図書室には人類の知識の総和が収められており、最も賢いコンピュータにしか読めないほど複雑な言語で書かれています。これらの「図書室」は、大規模言語モデル(LLM)と呼ばれています。それらは物語を書いたり、数学の問題を解いたり、友人のようにチャットしたりすることに長けています。しかし、一つ問題があります。それらはあまりにも巨大で重いため、たった一文を読むためだけに、膨大な量の電気と超高速のコンピュータを必要とするのです。もしこれらを一般的なノートパソコンやスマートフォンで使おうとすると、動作が非常に遅くなったり、重すぎて扱えなくなったりすることがよくあります。
これを解決するために、科学者たちは、重要な本を捨て去ることなく、これらの図書室をより小さくする方法を模索してきました。一つの方法は「プルーニング(枝打ち)」と呼ばれるものです。プルーニングをガーデニング(庭仕事)のように考えてみてください。あなたには巨大で生い茂った茂み(大きなコンピュータモデル)があり、それを整った小さな形にしたいと考えています。あなたは、枝ごと切り落とす(茂みを短くする)こともできますし、枝から葉を刈り取って枝を細くすることもできます(枝を細くする)。長い間、庭師たちは、枝ごと切り落とすか、あるいは枝の葉を刈り取るかのどちらか一方を選ばなければなりませんでした。問題は、茂みの健康を保ち、かつ実を結ぶ能力を維持したまま、どのようにして茂みを小さくするかということでした。
この論文では、「MoP」と呼ばれる新しいガーデニングツールを紹介しています。これは「Mixture of Pruner(混合プルーナー)」の略です。単に一つの方法を選んでトリミングするのではなく、MoPは両方の方法をあらゆるステップで試みる、賢い反復型の庭師です。あなたが茂みを整えている場面を想像してください。各カットにおいて、MoPは二つの質問を投げかけます。「もしこの枝を丸ごと切り落としたら、茂みはどう見えるか?」そして「代わりに、この枝から葉だけを刈り取ったら、どう見えるか?」と。そして、元の健康的だった植物に最も近い状態を維持できる方を選択します。このように、枝を切ることと葉を刈り取ることを交互に繰り返しながら、茂みがあなたのバックパックに収まるサイズになるまでプロセスを続けます。
研究者たちは、LLaMA-2やLLaMA-3といった世界で最も賢いコンピュータの脳を用いて、この手法をテストしました。その結果、MoPは単一の手法を用いるよりも、これらのモデルを縮小させる上で非常に優れていることが分かりました。モデルを40%削減(40%小型化)した際、MoPは競合する手法と同等の賢さを維持したまま、回答速度を大幅に向上させました。実際、モデルの回答速度は39%速くなりました。さらに驚くべきことに、彼らは画像とテキストの両方を理解できるモデル(LLaVA-1.5と呼ばれます)でもテストを行いました。その結果、トリミングされたモデルにはテキスト(画像なし)のみを「教えた」にもかかわらず、そのモデルは以前とほぼ変わらない精度で画像を理解できることが判明しました。このことは、二つのトリミング戦略を組み合わせることで、モデルが非常に小さくなっても道を見失うことなく、より小さく、より速く、より賢いコンピュータの脳を作り出せることを示唆しています。
技術要約:MoP(Mixture of Pruners)によるLLMの圧縮
問題提起 大規模言語モデル(LLM)は膨大な計算需要に直面しており、性能を損なうことなくパラメータ数を削減し、推論を加速させる手法が必要とされている。モデルのプルーニング(枝刈り)は効果的な戦略であるが、既存のアプローチは通常、単一の次元に焦点を当てている。すなわち、深度プルーニング (トランスフォーマー層全体の削除)か、あるいは幅プルーニング (アテンションヘッドやMLPニューロンなどの内部コンポーネントの削除)のいずれかである。深度プルーニングは逐次的な計算量を削減することで優れた推論加速を提供し、一方で幅プルーニングは冗長な構造をより細粒度で選択できるため、ダウンストリームタスクの性能を維持しやすい傾向がある。本論文は、既存の文献におけるこれら相補的な強みが融合されることが稀であり、その結果、圧縮率、精度、およびレイテンシの間のトレードオフが最適化されていないという二分法を指摘している。
手法:Mixture of Pruners (MoP) 著者らは、深度プルーニングと幅プルーニングを統一された戦略へと統合する反復フレームワークであるMoP を提案する。コアとなるメカニズムは以下の通りである:
反復的なパス選択: 各イテレーションにおいて、MoPはプルーニングのパスを進めるための2つの候補モデルを生成する。
深度候補(Depth Candidate): 1つの完全なトランスフォーマー層を削除する(先行研究の知見に基づき、最終2層を保持するため、後ろから3番目の層を削除する)。
幅候補(Width Candidate): 層全体にわたってアテンションヘッドとMLPニューロンをプルーニングすることで、深度ステップで削除される層と同等のパラメータ数を削除する。
パラメータのマッチング: 公平な比較を確保するため、幅プルーニングのステップは、深度ステップで削除される単一の層と同じ数のパラメータを削除するように調整される。これには微細な制御が必要であり、著者らはAMP(Activation Magnitude Pruning)基準を用いてこれを実現している。
評価と選択: 両方の候補は、訓練データの一部を用いた短いリカバリ・ファインチューニングを受ける。その後、**パス基準(Path Criterion, P P P )**が、コサイン類似度、KLダイバージェンス、パープレキシティ(PPL)、あるいはランダム選択などの指標を用いて、元の未プルーニングモデルに対する候補のスコアを算出する。元のモデルとの偏差が最も小さい(スコアが最も近い)候補が選択され、次のイテレーションのベースとなる。
最終的なリカバリ: 目標とする圧縮率に達した後、最終的なプルーニング済みモデルに対して、完全な訓練データセットを用いたフルリカバリ・ファインチューニングを行う。
このフレームワークはモジュール式であり、幅と深度の異なるプルーニング基準や、異なるパス選択戦略の統合が可能である。
主な貢献 本論文は、主に5つの貢献を強調している:
統一されたフレームワーク: MoPは深度プルーニングと幅プルーニングを効果的に組み合わせ、層の削除によるレイテンシの利点と、コンポーネント削除による細粒度の選択性を捉えている。
モジュール性: 設計上、様々なプルーニング基準の組み合わせに対応しており、最新の手法の統合を可能にしている。
多様なプルーニング・スキーム: 両方の次元に削除を分散させることで、MoPは単一の次元を使い果たすことなく、より高い圧縮率を達成する。
マルチモーダルへの拡張: テキストのみに焦点を当てたほとんどのプルーニング文献とは異なり、著者らは言語のみ(LLaMA)およびマルチモーダル(LLaVA)アーキテクチャの両方でMoPをテストしている。
視覚タスクに対するテキストのみのリカバリ: 著者らは、テキストのみのデータセット(Alpaca)を用いたリカバリ・ファインチューニングが、プルーニングされた視覚言語モデルの視覚的ベンチマークにおける性能を驚くほど回復させることを観察している。
結果 著者らは LLaMA-2 7B、LLaMA-3 8B、および LLaVA-1.5 7B において MoP を評価している:
精度: LLaMA-2 および LLaMA-3 において、MoP は 20%、30%、および 40% の圧縮率にわたり、競合する構造化プルーニング手法(例:SliceGPT, AmoebaLLM, PruneNet)を一貫して上回っている。特筆すべきは、MoP の「ワーストシード(最悪の種)」の性能であっても、競合する最良のベースラインの平均性能を上回ることが多く、これはパス選択の分散に対する堅牢性を示している。
レイテンシ: MoP は構造的プルーニングを実質的な速度向上へと変換する。40% 圧縮時、本手法は NVIDIA RTX 4090 上でエンドツーエンドのレイテンシを 39% 削減(1.63倍の高速化)する。30% 圧縮時には 1.38倍の高速化を達成しており、同等の利点を得るために、より積極的な圧縮(例:50%)を必要とする他の手法を凌駕している。
マルチモーダル性能: LLaVA-1.5 において、MoP は重要な推論能力を維持している。40% 圧縮時、モデルは平均的な予測能力の約 78% を保持している。決定的なことに、本研究は、テキストのみのデータ(Alpaca)を用いたファインチューニングが、視覚タスク(ScienceQA, VizWiz)における性能を効果的に回復させることを示しており、これは著者らが新しい発見として挙げている。
意義と主張 本論文は、MoP が単一軸のアプローチによる構造的な硬直性を克服することで、構造化プルーニングにおける新たな境地を切り開いたと主張している。このハイブリッド戦略は並外れた回復力を提供し、たとえ不利なパス選択が行われた場合でも、トップクラスの精度を実現することを保証する。著者らは、このアプローチが効率的な LLM のための最先端技術を進展させるだけでなく、マルチモーダル領域におけるハイブリッドな幅・深度プルーニングの実行可能性を検証したものであると強調している。さらに、視覚言語モデルにおける視覚タスクへのテキストのみのリカバリ・ファインチューニングが十分であるという発見は、圧縮されたマルチモーダルシステムの展開において、高価なマルチモーダル・リカバリ・データセットの必要性を減らす、より効率的な経路を示唆している。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×