Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models
本論文は、エキスパートの選択と確率の再正規化を分離することで、減少したアクティブなエキスパート集合ではなく、より大きな参照用エキスパート集合に対して正規化を行い、性能を維持しつつ、推論時における細粒度Mixture-of-Expertsモデルの計算コストを半減させる学習不要な手法を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代のテキスト生成を行う人工知能システムは、保持している知識の総量と、単語ごとに実際に行う思考量を切り離す設計に依存していることが多い。何千冊もの専門書が入った巨大な図書室を想像してほしいが、一文を書くたびに、システムはその中のほんの一握りの本だけを開いて適切な情報を見つけ出す。Mixture-of-Experts(混合専門家)モデルとして知られるこの手法により、コンピュータは会話のたびに速度を落とすことなく、膨大な量のデータを蓄積することができる。システムは小さな内部ガイドを使用して、各単語に対してどの特定の書籍を開くかを決定し、その瞬間には全図書ライブラリのごくわずかな部分のみが参照されるようにしている。これにより、コンピュータはあらゆるトピックに対応できるよう棚にすべての本を置いておく必要がある一方で、一度に読むのは数ページだけであるという、独特な状況が生み出される。
コンピュータはこれらの専門的なセクションをすべてメモリに保持しなければならないため、研究者たちは、システムにさらに少ないページを読ませることで高速化する方法を長年模索してきた。この標準的な方法は単純である。すなわち、文章ごとに開く本の数を減らすようシステムに命じることだ。しかし、この単純なアプローチは、歴史的にシステムを混乱させ、より多くの間違いを引き起こしてきた。この混乱は、システムに適切な本が足りないからではなく、本の数が減少したときに、それらの本の情報の重み付けの仕方が予期せず変化してしまうために起こる。Xing ChenとHengshuai Yaoによる新しい研究は、この混乱がシステムによって自動的に行われる隠れた数学的な調整によって引き起こされていることを明らかにし、彼らはシステムを再学習させたり新しいコンポーネントを追加したりすることなく、その調整をオフにする方法を見出した。
研究者たちは、350億のパラメータを持つモデルと、400億近くのパラメータを持つモデルという、2つの非常に大規模な言語モデルに焦点を当てた。これらのモデルは、処理の各レイヤーごとに、数百の小さな専門的なセクション、すなわち「エキスパート」を備えるように設計されている。標準的な動作では、システムは処理する単語ごとに8つのエキスパートを選択する。研究者がこの数を半分に減らし、4つのエキスパートのみを使用するように強制してシステムを高速化しようとしたところ、パフォーマンスが大幅に低下した。一般的な知識に関する標準的なテストにおいて、精度は5ポイント近く低下した。この損失があまりに深刻であったため、多くの人々は、アクティブなエキスパートの数を減らすことは単にコストがかかりすぎるため、有用ではないと考えてきた。研究者たちは、問題はエキスパート自体の欠如ではなく、むしろ残されたエキスパートの重要性をシステムがどのように再校正するかにあるのではないかと疑った。
標準的なセットアップでは、システムがトップのエキスパートを選択する際、それらの合計の重要性が常に一定の総和になるように、その影響力を調整する。これはシステムを安定させるための安全装置である。しかし、これらの細粒度モデルでは、通常、トップ8つのエキスパートは、考えられる全的な重要性のうちごくわずかな割合しか占めていない。システムが強制的に4つのエキスパートのみを選択する場合、標準的な調整は、差分を埋めるためにそれらの影響力を大きな係数で乗じる。この突然のブーストは、システムをそれが扱えるよう訓練されていない状態へと押し上げ、過剰反応とエラーを引き起こす。研究者たちは、システムは実際に情報を失っているのではなく、単に本来よりも大きな声で叫ぶように命じられているのだと気づいた。
これを解決するために、チームは追加のトレーニングや追加の計算能力を必要としないシンプルな変更を導入した。彼らは、どのエキスパートを使用するかという決定と、それらの重みをどのように付けるかという決定を分離した。彼らは、システムに4つのエキスパートのみを使用して作業を行うことを許可したが、重要度の重みを計算する際には、単なる4つではなく、トップ16のエキスパートに基づいて計算するように指示した。こうすることで、システムは使用するアクティブなセクションの数が半分になったとしても、これまで聞き慣れていた情報量を維持することができた。この調整は、単一の整数設定を変更するという極めて小さな変更であるが、結果を劇的に変えた。350億パラメータのモデルにおいて、この新しい設定を用いてアクティブなエキスパートを8から4に減らしたところ、精度はわずか0.35ポイントの低下にとどまり、これは元の低速なシステムとの差が統計的に区別がつかないほど微小なものであった。
研究では、この手法をより大規模な400億パラメータのモデルでもテストしたが、結果は同様に劇的であった。標準的な方法でアクティブなエキスパートを半分に減らすと大幅なパフォーマンス低下を招いたが、この新しい重み付け手法を使用すると、損失はわずか0.55ポイントに抑えられた。研究者たちは、この新しい重み付けにおける最適な設定は、特定のタスクに依存することを発見した。例えば、テキストを読む際に最も優れた響きを持つ設定が、必ずしも論理パズルや知識テストで最高のパフォーマンスを発揮するわけではない。この発見は、圧縮されたモデルがテキストをどれだけ流暢に読むかを測定するだけでは、他のタスクでうまく機能することを保証するには不十分であることを示唆している。研究者たちは、これらのモデルに必要な計算能力を安全に削減するためには、テキストの流暢さだけに頼るのではなく、実際のパフォーマンス・テストを用いてこの重み付け設定を注意深くチューニングしなければならないと結論づけた。
また、論文では、単に余分なエキスパートを一時的に使用しないだけでなく、恒久的に削除することがなぜ難しいのかについても探求した。彼らは、これらのモデルが高度に専門化されており、コードや一般的な文章など、異なる種類のコンテンツを扱う異なるエキスパートが存在することを発見した。これらのエキスパートは非常に専門化されており、システムもまた高度にバランスが取れているため、多様なトピックを扱う能力を失うことなく、それらを永久に削除する余地はほとんどない。したがって、最も効果的な道筋は、モデルの一部を捨てることではなく、単に一度に使うパーツの数を減らしつつ、処理する情報の全体的なボリュームを一貫させることである。このアプローチは、ルールが変わったときに発生する隠れた校正エラーを修正することにより、知能を犠牲にすることなく、これらの強力なシステムをより高速かつ効率的にするための方法を提供する。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。