← 最新の論文
💻 computer science

Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model

本論文は、Transformerを独立して訓練可能なレイヤーブロックへと分割し、それらを一貫したモデルへと再構成できる足場付きのモジュール型事前学習フレームメントであるMixture of Training(MoT)を導入しており、このような分解された実行が、再利用可能な足場を通じて計算上の利点をもたらす可能性を提供しつつ、モノリシックな訓練と同等の品質を実現できることを示している。

原著者: Mohammed Sabry, Sean Augenstein, Keith Rush, Lucio Dery

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Mohammed Sabry, Sean Augenstein, Keith Rush, Lucio Dery

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、レゴブロックを使って巨大で複雑なお城を作ろうとしています。通常、これを行う唯一の方法は、一つの巨大な建築チームが、構造物全体に対して同時に作業することです。もし誰か一人がブロックを落としたら、チーム全員が作業を止めなければなりません。また、チームが大きくなりすぎると、部屋は混雑し、プロジェクトの修正には膨大な費用と時間がかかるようになります。これが、科学者が通常「大規模言語モデル(LLM)」を構築する方法です。LLMとは、物語を書いたり、質問に答えたり、私たちとチャットしたりできる、非常にスマートなコンピュータの脳のことです。これらは、一つの巨大で壊れることのない塊として訓練されます。しかし、もしお城を別々の小さな部屋ごとに作り、それぞれの部屋に対して異なるチームを独立して働かせ、最後にそれらすべてをパチンと組み合わせることができたらどうなるでしょうか?それが、この論文が投げかけている大きな問いです。「スマートなAIの訓練を、後で組み立て可能な、より小さく管理しやすい断片に分解することはできるのだろうか? その際、魔法のような能力を失うことなく?」

「Mixture of Training(またはMoT)」というプロジェクトに取り組んでいる研究者たちは、このアイデアをテストすることに決めました。彼らは単に推測したわけではありません。13億パラメータを持つAIモデル(「Gemmaスタイル」のモデル)を構築し、それをスライス(切り分け)して訓練することを試みました。モデル全体を一度に訓練する代わりに、彼らはモデルを2つの大きな塊に分割しました。これらの塊が後でうまく適合するようにするために、彼らは巧妙なトリック、「足場(scaffold)」を使用しました。これは、パーツが組み立てられている間にそれらを固定しておく、補助輪や硬いフレームのようなものだと想像してください。彼らはこのフレーム(「アライナー」と呼ばれます)を固定して変化しないようにし、そのフレームの中で各チャンク(塊)を訓練しました。こうすることで、それぞれのチャンクは個別に訓練されているにもかかわらず、データの同じ「言語」を話せるように学習したのです。

結果は、「成功した!」と「条件による」が混ざり合ったものでした。チームは、これらの独立して訓練されたチャンクを実際に取り出し、パチンと組み合わせることで、機能するAIが得られることを発見しました。しかし、それらを結合した瞬間、AIは少し混乱し、より多くの間違いを犯しました(標準的な15.0に対し、パープレキシティ・スコアが19.3と高くなりました)。しかし、ここからが面白い部分です。モデル全体に少しの間だけ「対話」をさせる短い「チューニング」セッションを行った直後、AIは従来の巨大な塊による手法と同じくらい優れた性能になりました。実際、彼らは、従来の標準的な手法と同じ計算量を用い、かつ全く同じ品質に到達する方法を見つけ出したのです。

しかし、注意点もあります。この論文は、この方法がすべての人にとって即座にコストを節約できる魔法の杖ではないことを示唆しています。「足場」自体を最初に構築するために、多くのエネルギーを必要とするからです。もしあなたが一つだけAIを作るのであれば、足場のせいでプロセス全体が従来の方法よりも高価になります。しかし、もしその同じ足場を再利用して、多くの異なるAIを作る場合(例えば、同じ補助輪を使って3つ以上のお城を作る場合)、1つあたりのコストは下がり、この方法が勝者となります。研究者たちはまた、AIをあまりに細かく分けすぎると、それらを組み合わせるのが難しくなり、品質が低下することも発見しました。したがって、これはまだ、巨大な一体型の訓練方法に取って代わるものではありませんが、AIの訓練を、より小さく、再利用可能で、並列化可能なジョブに分解することが可能であることを証明しています。これは、AIの実験を行うための新しい方法を切り開き、ミスを修正したり、作業の一部を再開したりすることを容易にし、将�的に、都市規模のスーパーコンピュータを必要とせずに、よりスマートなモデルを訓練できる可能性を広げるものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →