Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model
本論文は、Transformerを独立して訓練可能なレイヤーブロックへと分割し、それらを一貫したモデルへと再構成できる足場付きのモジュール型事前学習フレームメントであるMixture of Training(MoT)を導入しており、このような分解された実行が、再利用可能な足場を通じて計算上の利点をもたらす可能性を提供しつつ、モノリシックな訓練と同等の品質を実現できることを示している。
原著者:Mohammed Sabry, Sean Augenstein, Keith Rush, Lucio Dery
「Mixture of Training(またはMoT)」というプロジェクトに取り組んでいる研究者たちは、このアイデアをテストすることに決めました。彼らは単に推測したわけではありません。13億パラメータを持つAIモデル(「Gemmaスタイル」のモデル)を構築し、それをスライス(切り分け)して訓練することを試みました。モデル全体を一度に訓練する代わりに、彼らはモデルを2つの大きな塊に分割しました。これらの塊が後でうまく適合するようにするために、彼らは巧妙なトリック、「足場(scaffold)」を使用しました。これは、パーツが組み立てられている間にそれらを固定しておく、補助輪や硬いフレームのようなものだと想像してください。彼らはこのフレーム(「アライナー」と呼ばれます)を固定して変化しないようにし、そのフレームの中で各チャンク(塊)を訓練しました。こうすることで、それぞれのチャンクは個別に訓練されているにもかかわらず、データの同じ「言語」を話せるように学習したのです。
手法:Mixture of Training (MoT) 著者らは、ターゲットとなるTransformerを連続したレイヤーブロックに分割するように設計された、足場(scaffolded)を用いたモジュール式事前学習手順である**Mixture of Training (MoT)**を導入する。この手法は、以下の3つのステージで動作する。
ステージ 0(準備): 学習済みのアライナー(aligner) (A) を選択または準備する。ターゲットとなるTransformer (F) とアライナーは、共に K 個の連続したレイヤーブロックに分割される。アライナーは、グローバルな幅、アテンション・ヘッドの次元数、フィードフォワード幅、トークン埋め込み、および出力ヘッドを共有し、ターゲットと形状の互換性を持つ。
「品質パリティ」スケジュールは、より多くの総計トークン(47.1B vs. 33.6B)を処理し、より短い理想的なクリティカルパス(1.7倍の高速化の可能性)を持っていたが、アライナーのコストを単一の実行に完全に充当した場合、より多くの総FLOPs(285.0 EFLOPs vs. 268.4 EFLOPs)を必要とした。
しかし、アライナーが R 個の独立した実行に対して再利用される場合、実効コストは低下する。論文では、R≥3 の場合、実効コストがモノリシックなベースラインを下回ることが記されている。