← 最新の論文
🤖 machine learning

MAPLE: MoE Adaptive Plug-and-play Layer-wise Expert allocation

MAPLEは、感度に基づいてエキスパートの予算を層ごとに異種的に解析的かつ遺伝的に再配分することにより、重みの変更や再学習を必要とせずに、優れた精度と大幅なレイテンシ削減を実現し、学習済みMixture-of-Experts (MoE) モデルの効率を最適化するプラグアンドプレイのフレームワークである。

原著者: Lie Li, Wen Li, Junxiao Shen, Gusheng Hu

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Lie Li, Wen Li, Junxiao Shen, Gusheng Hu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の人工知能は、多くの場合、トランスフォーマーと呼ばれる巨大なデジタル脳に依存しており、これらは情報の連鎖である長いレイヤー(層)を通じて言語を処理します。これらのレイヤーを、モデルが文脈、文法、そして意味を理解することを学ぶ一連の処理ステーションと考えてください。近年、エンジニアは「Mixture-of-Experts(混合エキスパート)」と呼ばれる設計を用いることで、これらのモデルをより効率的にしてきました。すべてのステーションが同じ量の計算能力を使用する代わりに、モデルはテキストを読み取るごとに、少数の特化したサブネットワーク、すなわち「エキスパート」のみを起動させます。これにより、システムは膨大なエネルギーを必要とすることなく、非常に大規模で有能なものになることができます。しかし、これまで、これらのエキスパートの使用方法については、ある標準的なルールが支配していました。それは、たとえそのレイヤーが実際にそれほど多くの助けを必要としていなくても、連鎖内のすべてのレイヤーにおいて、起動されるエキスパートの数が全く同じになるよう強制されるというルールです。

ブリストル大学の研究チームは、この一律のルールに異を唱え、AIモデルの各レイヤーには非常に異なるニーズがあることを提案しました。高度に敏感で、正しく機能するために多くのエキスパートを必要とするレイヤーもあれば、冗長であり、精度を損なうことなくより少ないエキスパートで動作できるレイヤーもあります。彼らは、「MAPLE」と呼ばれる新しい手法を開発しました。これは「プラグアンドプレイ」のツールとして機能します。つまり、既存の学習済みモデルを再学習させたり、内部の重みを変更したりすることなく、既存のモデルに適用できることを意味します。このシステムは、まず、エキスパートの数を減らした場合に各レイヤーのパフォーマンスがどの程度低下するかをテストすることから始まります。次に、この測定値を使用してカスタムマップを作成し、リソースを余らせることができるレイヤーから、それを最も必要としているレイヤーへと計算予算をシフトさせます。

このアプローチの結果は驚くべきものです。研究者がMAPLEを4つの異なる大規模言語モデルでテストしたところ、既存のリソースを単に再分配する方が、それらを均等に使用するよりも効果的であることがわかりました。DeepSeek-MoE-16Bと呼ばれるモデルを用いた特定のテストでは、この新手法は、利用可能なエキスパートのわずか75%を使用しながら、元のフルロードのモデルを上回る性能を発揮しました。いくつかの推論ベンチマークにおいて、精度は大幅に向上しました。例えば、科学の質問回答タスクでは、スコアが65.09から71.40へと跳ね上がり、論理推論テストでは48.49から51.50へと上昇しました。これは、一様性という古い仮定がモデルの足を引っ張っていたことを示しており、努力のよりスマートで不均一な分配が、より良い結果をもたらすことを証明しています。

単により賢い回答を得るだけでなく、この手法はモデルの実行をより速く、より安価にします。より少ないエキスパートが起動されるため、コンピュータは質問に答えるたびにこなすべき作業が少なくなります。研究者がMAPLEを実際のサービングシステムに実装したところ、単一のグラフィックスカードにおけるレスポンス生成の時間が32.2%削減されたことが測定されました。同時に、システムは毎秒47.4%多いリクエストを処理できるようになりました。これらの利得は、モデルのコア構造を変更したり、学習された知識を破棄したりすることなく達成されました。システムは、単に既存のパーツをより効率的に使う方法を学んだだけなのです。研究者は、この改善が特定のテストによる偶然の現象ではなく、さまざまな種類の推論タスクにおいて、またモデルをスケールアップまたはスケールダウンさせた場合でも維持される、堅牢な発見であることを確認しました。

この研究はまた、モデルが問題を解決するために長い思考の連鎖を生成しなければならない、複雑な「マルチステップ推論」というタスクをどのように扱うかについても調査しました。これらの要求の厳しいシナリオにおいても、再分配されたモデルは精度を維持しながら、問題を解決するために必要な総時間を、場合によっては半分以上削減しました。研究者たちは、この手法が異なるモデルとも柔軟に連携できること、そして作成された割り当て計画は、毎回再計算することなく様々なタスクに対して再利用できることを示しました。一律の(ワンサイズ・フィッツ・オール)アプローチが最適ではないことを証明することで、この研究は、大規模な人工知能システムをより効率的、強力、かつ実世界の展開に適したものにするための、実践的かつ原理的な方法を提示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →