← 最新の論文
💻 computer science

SHIFT-LLM: Distribution Shift Correction in Depth-Pruned LLMs

SHIFT-LLMは、Transformerブロックの削除によって引き起こされる分布シフトを補正するために、閉形式の回帰を通じて較正された軽量な線形残差アダプタを挿入することで、深さ方向のプルーニングが行われた大規模言語モデルの精度を回復させる、学習不要のポストプルーニング・フレームワークである。

原著者: Ali Bahri, Hang Li, Hongliang Li, Zhitang Chen

公開日 2026-08-27
📖 1 分で読めます☕ さくっと読める

原著者: Ali Bahri, Hang Li, Hongliang Li, Zhitang Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデルは、物語を書いたり、問題を解決したり、複雑な質問に答えたりすることができる、今日の最も高度な人工知能ツールの背後にあるエンジンです。これらのシステムは、情報の層が下の層から受け取った情報を洗練させながら積み重なっていく、多層階のビルのように、デジタル処理ユニットが何層にも重なって構築されています。ビルに階層が多いほど、最終的な出力はより詳細で洗練されたものになりますが、これは構造を非常に重く、運用コストを高くすることにもなります。多くの実用的なアプリケーション、特に電力やメモリが限られているデバイスにおいては、これらの巨大なモデルはあまりに大きすぎて使用することができません。これらを小さくするために、研究者たちは建物からフロア全体を取り除く手法を開発しました。これは「デプス・プルーニング(深さの枝刈り)」として知られるプロセスです。この手法は負荷を軽減しモデルを高速化することには成功していますが、多くの場合、残されたフロアが躓いてしまいます。なぜなら、取り除かれたフロンドは上の層へ特定の種類の情報を渡すように設計されていたため、それらを取り去ると、上の層は学習時に期待していたものとは一致しない信号を受け取るようになり、混乱してしまうからです。この不一致は「分布シフト」と呼ばれ、モデルの精度を低下させ、ミスを引き起こします。その結果、開発者はエラーを修正するために、膨大な時間と計算能力を投じてモデルを再学習させることを余儀なくされます。

Huawei Noah's Ark Labの研究チームは、再学習を必要とせずにこの問題を解決する、「SHIFT-LLM」と呼ばれる新しいアプローチを導入しました。取り除かれたフロアを再構築したり、残されたフロアを再学習させたりする代わりに、彼らの手法は、レイヤーが削除されたすべての箇所に、小さく軽量な補正モジュールを挿入します。もし、あるビルからフロアを取り除いた場合、そこに、隙間を完璧に埋めるカスタムメイドのシンプルなスロープを設置し、上の階の人々が、もし欠けているフロアがまだ存在していた場合と同じ指示を正確に受け取れるようにすることを想像してみてください。デジタル世界において、このスロープは、情報の直接的な経路を維持しながら、微小で計算された調整を加える「線形アダプター」です。この調整は、取り除かれたレイヤーが果たしたはずの具体的な貢献を模倣するように設計されており、実質的に、欠けているフロアがまだ存在しているかのように他のモデルを欺くのです。

この手法の素晴らしさは、その調整をどのように算出するかという点にあります。欠けているレイヤーが何をすべきだったかを理解するために数千時間のトレーニングを行うのではなく、研究者たちは少量のサンプルデータを使用して、失われた情報が正確にどのようなものであるかを測定します。そして、失われた情報を復元するために必要な正確な補正を、単純な数学的計算を用いて決定します。このプロセスは完全に自動化されており、通常、壊れたモデルを修正するために必要とされる複雑で反復的な学習プロセスである「勾配ベースの最適化」を必要としません。この閉形式(クローズドフォーム)の計算を用いることで、チームは数日間の計算時間ではなく、わずか数百の例を用いて数分でモデルの内部状態を修正することができます。その結果、プルーニングされたモデルは、より少ないレイヤーを持つことによるスピードと効率性を維持しながら、元の巨大なモデルとほぼ同等の精度を発揮します。

研究者たちは実験において、15億パラメータの小型モデルから140億パラメータの大型モデルまで、5つの異なる大規模言語モデルのファミリーに対してこの技術をテストしました。彼らはどのレイヤーを取り除くかを決定するために6つの異なる手法を適用し、一般的な知識と推論をテストするために設計された7つのベンチマークで結果を評価しました。結果は一貫していました。補正モジュールは、ほとんどすべての構成において、プルーニング中に失われた精度を正常に回復させたのです。ある80億パラメータのモデルに関する顕著なケースでは、この手法は標準的なベンチマークにおいて、驚異的な15.7ポイントの精度を回復しました。これは、通常であれば広範で高価な再学習を必要とする利得です。モデルがプルーニング後にすでにファインチューニングされている場合でも、この補正モジュールを追加することでさらなるブーストが得られたことは、これら二つのアプローチが性能をさらに高めるためにうまく機能することを示唆しています。

研究者たちはまた、これらの補正モジュールをさらに圧縮してスペースを節約したり、複数のレイヤーが連続して削除された場合にそれらを統合したりできることも実証しました。これにより、修正によるオーバーヘッドによってプルーニングによる効率向上のメリットが失われないようにしています。この研究は、大規模言語モデルを小型化する際の主な障害は、単に部品を取り除くことではなく、それらの間の情報の流れを乱すことであることを示唆しています。単純で的を絞った調整によってその流れを修復することに焦点を当てることで、SHIFT-LLMは、強力なAIモデルを日常的な用途に実用化するための、一般的かつ効率的な方法を提供します。この研究は、適切な補正さえあれば、デジタルな脳の重くて冗長な部分を取り除いても、明確に思考する能力を失うことなく、より速く、より安価で、より身近な人工知能への扉を開けることを裏付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →