Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts
本論文は、スパースなMixture-of-Expertsモデルにおける最適なスパース性は、従来の計算量最適化に基づくスケーリング則のみを通じてではなく、モデルアーキテクチャをハードウェアの制約と共同で最適化することによって初めて現れることを示す、システム認識型の協調設計フレームワークであるMOSAICを紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
究極の、最も強力なロボットの脳を構築しようとしていると想像してください。人工知能の世界において、この「脳」は大規模言語モデル(LLM)と呼ばれる巨大なコンピュータプログラムです。これらの脳をより賢くするために、科学者たちはシンプルなルールを発見しました。それは、より多くのデータを与え、規模を大きくすれば、世界に対する理解が深まるというルールです。このルールは「スケーリング則(scaling law)」と呼ばれます。長い間、これらの脳を構築するためのレシピは、2つの独立したステップに分かれていました。まず、数学者が利用可能な計算資源(「計算量(compute)」と呼ばれます)に基づいて、脳の最適なサイズを決定します。次に、別のエンジニアが、その脳を特定のコンピュータチップ上に押し込み、いかに速く動作させるかを試みます。
これは、ロードトリップの計画を立てるようなものです。最初のステップは、ガソリンの予算に基づいて、どれくらいの距離を走りたいかを決めることです。2番目のステップは、車を選ぶことです。しかし、もし選んだ車が非常に重くて鈍重で、ガソリンをひどい割合で消費してしまうとしたら、どうなるでしょうか?そうなれば、計画していた距離を実際に走ることはできません。これが、この論文が取り組んでいる問題です。著者は、単に脳のサイズを選んでから、後で車について心配すればよいのではないと主張しています。脳の形が変われば、車の走行効率も変わるため、脳と車を一緒に設計しなければならないのです。もしエンジンのことを無視してしまえば、結果として「完璧な」脳を作ったとしても、それは動きすぎるには重すぎる存在となり、スタートラインに取り残されてしまうことになるのです。
問題:収まりの悪い「完璧な」脳
この論文は、MOSAIC(Model Optimization via Systems-Aware TraIning Co-design:システムを意識したトレーニングの共同設計によるモデル最適化)と呼ばれる新しい考え方を導入しています。Amazon AGI Foundationsの著者たちは、従来の手法では機会損失が生じていることに気づきました。従来、研究者たちは「計算最適(Compute-Optimal)」なモデルを算出していました。これは、固定された計算資源の中で最高の成果が得られるモデルのサイズであり、すべての計算資源が完璧に使用されることを前提としています。
しかし、著者らは隠れた罠を発見しました。彼らは、**混合専門家(Mixture-of-Experts: MoE)**と呼ばれる特殊なAIアーキテクチャに注目しました。これは、巨大な図書館を想像してください。そこでは、一人の巨大な司書がすべての本を読むのではなく、数千の特化した専門家がいます。質問が入ってくると、スマートなルーターが、その質問に答えるために、わずか数人(例えば100人のうち2人)の専門家へと情報を送ります。これにより、モデルはすべての図書館を呼び起こす必要がないため、非常に高速かつ効率的になります。
従来の数学によれば、最高の成果を得るためには、図書館をできるだけ巨大にし、呼び起こす専門家をできる限り少なくすべきだとされています。言い換えれば、「完璧な」モデルとは、極めて疎(sparse)である(=スカスカである)はずだということです。つまり、純粋に「計算にはどれだけの演算が必要か?」という数学的な観点だけで考えると、答えは常に「可能な限り疎にせよ」となります。数学上の最適な希薄度は、限界値のすぐそばにあるのです。
ひねり:エンジンが重要であること
ここで物語が変わります。著者らは、数学が「極限まで疎にせよ」と言っていたとしても、コンピュータチップという物理的な現実が「いや、無理だ」と言っていることに気づきました。
数千の小さな専門家を持つモデルの場合、コンピュータは、どの専門家を呼び起こし、どのように情報を受け渡すかを決定するためだけに、膨大な追加作業を行わなければなりません。これは、巨大なオフィスビルにおいて、マネージャーがメモを届けるために一日中キュービクル間を走り回っており、肝心の仕事にほとんど時間を割けていない状態に似ています。モデルが疎になればなるなるほど、コンピュータはこれらの「走り回る」タスク(通信コストと呼ばれます)に時間を浪費し、実際の「思考(計算)」に充てる時間が減ってしまうのです。
この論文は、従来の「計算最適」な数学に欠陥があると主張しています。なぜなら、その数学は、コンピュータが全パワーの100%を思考部分に投入できると仮定しているからです。実際には、超疎なモデルは、コンピュータのパワーのわずか8%しか実際の思考に使えず、一方で少し密度の高いモデルであれば15%を使えるかもしれません。
解決策:MOSAIC
これを解決するために、チームはMOSAICを構築しました。彼らは「固定された量の計算に対して、最高のモデルは何か?」と問うのではなく、「我々の特定のコンピュータ・クラスター上で、固定された時間内に実際に実行できる最高のモデルは何か?」と問い直しました。
彼らは2つの要素を組み合わせました:
- スケーリング則: モデルのサイズと形状に基づいて、そのモデルがいかに賢くなるかを予測するもの。
- パフォーマンス・モデル: 「走り回る」コストを考慮に入れ、モデルが実際のハードウェア上でどれほどの速さで動作するかを予測するシミュレーター。
MOSAICを実行した結果、驚くべきことが判明しました。「完璧な」モデルとは、極端な希薄度の端にあるものではありませんでした。代わりに、最適なモデルは内部解(interior solution)、つまり「幸福な妥協点」でした。それは、効率的であるために十分な疎さを持ちつつも、コンピュータが膨大な数の小さな専門家を管理するオーバーヘッドによって停滞してしまうほどではない、絶妙なバランスを備えていたのです。
判明したこと
チームは、NVIDIA B200 GPUを用いた実機テストを行いました。これには、7億から180億のアクティブ・パラメータ(総パラメータ数は最大790億)を持つモデルが含まれます。
- 従来の方法: もし従来の数学に従った場合、希薄度は約0.985(つまり、98.5%の専門家が眠っている状態)のモデルを選ぶことになります。しかし、彼らの特定のクラスターでは、このモデルはあまりにも遅すぎて訓練に永遠の時間がかかり、実際には、もう少し密度の高いモデルよりも賢くなくなるという結果になりました。
- MOSAICの方法: システムは、最適な希薄度は約0.96であるという「スイートスポット」を見つけ出しました。このモデルは「理論上の」最高ではありませんでしたが、「実践上の」最高でした。これはより速く動作し、コンピュータのパワーをより効率的に使い、かつ(理論上の最高よりも)低いエラー率(つまり、より賢い)を達成しました。
実際、彼らは、紙の上で最も良く見えるモデル(最も多くの「Model FLOPs」を持つモデル)が、現実には最も訓練に時間がかかることを示しました。勝利したのは、数学とハードウェアの現実とのバランスを取ったモデルでした。
なぜこれが重要なのか
この論文は、AIモデルの設計と、それを動かすコンピュータの設計を別々のステップとして扱うべきではないことを示唆しています。モデルのサイズを選んでから、コンピュータがそれを扱えるかどうかを祈る、というやり方は通用しません。モデルの「形」が、コンピュータの挙動を変えてしまうからです。
著者らは、自分たちの知見が使用した特定のコンピュータチップ(NVIDIA B200)や、独自に構築したソフトウェアに特有のものであるという点に注意を払っています。彼らは、宇宙のあらゆるコンピュータに適用される普遍的な法則を見つけたわけではありません。しかし、彼らは、AIトレーニングの最前線において、「システム(ハードウェアやデータの移動方法)」を無視することは、不適切な結果を招くことを証明しました。
MOSAICを用いることで、彼らは「最高の」モデルとは、グラフ上の固定された一点ではなく、あなたの特定のハードウェア予算に依存して変化する、動的なターゲットであることを示しました。最も効率的なモデルとは、紙の上での見栄えが良いモデルではなく、あなたのクラスターに手袋のようにぴったりとフィットするモデルなのです。これは、「計算最適(Compute-Optimal)」から「クラスター最適(Cluster-Optimal)」への転換です。
要するに、もし可能な限り賢いAIを作りたいのであれば、単に大きな脳を作るだけでなく、その脳が住む「体」に適合する脳を作る必要があるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。