Training nGPT
本論文は、Logit Gradient PreconditioningやGatedAdamWといった技術を取り入れた正規化Transformer(nGPT)の実用的な学習レシピを提示しており、これにより14BパラメータのハイブリッドMamba-Transformer MoEモデルが、非正規化モデルと比較して約半分の学習トークン量で同等の検証損失を達成することを可能にしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能の世界を、コンピュータが物語を書いたり、数学の問題を解いたり、人間のようにチャットしたりすることを学ぼうとしている、巨大で賑やかな図書館だと想像してみてください。これを行うために、彼らは「ニューラルネットワーク」と呼ばれる特別な数学的構造を使用します。これは、相互に連結されたニューロンの巨大なウェブのようなものです。このウェブの中では、情報は数値として移動し、ネットワークはこれらのニューロン間の接続の強さを調整することで学習します。長い間、科学者たちは、これらの数値が乱れることがあることに気づいてきました。時にはあまりにも巨大になりすぎたり、時には何もかもが消えてしまうほど小さくなったりして、システム全体がどちらの方向に進めば賢くなれるのか分からなくなってしまうのです。これは、重さが変わり続けるバックパックを背負って、急で霧深い山を登ろうとしているようなものです。一歩前へ進んだと思ったら、すぐに右へと滑り落ちてしまうかもしれません。この研究の目的は、コンピュータがより速く、より効率的に学習の山を登れるよう、そのバックパックを運ぶより良い方法を見つけることです。
あなたがこれから読む論文は、イリヤ・ロシロフとボリス・ギンズブルグ率いるNVIDIAのチームによるものです。彼らは特定の課題に取り組んでいます。それは、すべての内部数値を完璧に見えない球体上に留めるように強制することで、いかにAIモデルをより良く学習させるかという問題です。これは、「どんなに遠くまで歩いても、常に街の中心から正確に1マイル離れていなければならない」というルールのようなものです。「正規化(ノーマライゼーション)」と呼ばれるこのルールは、数値が大きすぎたり小さすぎたりするのを防ぎ、コンピュータが集中力を維持する助けとなります。著者たちは、「nGPT(正規化GPT)」と呼ばれる以前のアイデアに基づき、二つの異なるテクノロジーを組み合わせた非常に現代的で強力なAIのタイプ、すなわち「Mamba-2」(長いシーケンスを記憶することに長けている)と「Transformer」(文脈を理解することに優れている)を混ぜ合わせたものを用いてテストを行いました。彼らは、自分たちの新しいトレーニングルールが、標準的な方法よりもこれらのハイブリッドモデルを速く学習させることができるかどうかを確認したいと考えました。
大きなアイデア:新しいトレーニングのレシピ
著者たちは単に一つの要素を微調整しただけではありません。彼らはこれらのAIモデルのための、全く新しい「トレーニングのレシピ」を作り上げました。あなたがロボットに歩き方を教えているところを想像してください。従来の方法(AdamWと呼ばれる標準的な手法)は、ロボットを放任して、時には巨大で不器用なステップを踏ませ、時には小さくてためらいがちなステップを踏ませながら、最終的に道を見つけられることを願うようなものです。彼らが「nGPTトレーニングレシピ」と呼ぶ新しいレシピは、ロボットのステップを完璧に保つための非常に具体的なルールを備えた、トレッドミルに乗せるようなものです。
以下に、日常的な概念を用いて、彼らがどのように行ったかを分かりやすく説明します。
1. 「ロジット勾配プリコンディショニング」(音量のつまみ)
AIが文章の次の単語を予測しようとする際、それは「ロジット」と呼ばれるスコアのリストを生成します。古いシステムでは、学習が進むにつれて、これらのスコアの音量が奇妙に大きくなったり静かになったりして、ロボットがどの程度強く押すべきかについて混乱させてしまうことがありました。著者たちは、調整可能なスケールベクトルである特別な「音量のつまみ」を追加しました。しかし、ここが巧妙な点ですが、単につまみを回すだけでは、ロボットの歩き方の記憶を乱してしまうことに気づきました。そこで、彼らは「ロジット勾配プリコンディショニング」というトリックを考案しました。これは、音量が変わる音量つまみがあるものの、ロボットが間違いから学ぼうとする際、システムが自動的に音量を正常に戻し、ロボットが混乱しないようにするようなものです。これにより、予測の「大きさ」が変化しても、学習プロセスは安定したまま保たれます。
2. 「対数学習率減衰」(スピードレーサー)
通常、AIをトレーニングする場合、最初は速い学習速度で始め、徐々に速度を落としていきます。これは、レーシングカーのドライバーがアクセルを緩めていくようなものです。著者たちは、標準的な減速方法(滑らかな曲線のようなもの)が、彼らの新しい「球体」システムには最適ではないことを見出しました。代わりに、彼らは「対数学習率減衰」を使用しました。これは、スタートラインから猛スピードで飛び出し、最初は非常に素早く減速して感覚を掴み、その後はレースの残りの期間、長く安定したテール部分をクルージングするレーシングカーを想像してください。この「フロントロード型」のスケジュールにより、モデルは基礎を素早く学び、その後長い期間にわたってスキルを磨くことができ、これが非常に効率的であることが判明しました。
3. 「GatedAdamW」(スマートな門番)
ロボットの脳を更新する標準的な方法はAdamWと呼ばれます。著者たちはこれを「GatedAdamW」へとアップグレードしました。標準的な方法を、どんなに小さく、ほとんど気づかれないような更新であっても、あらゆる更新を通してしまう門番だと考えてみてください。時には、これらの小さな更新はただのノイズに過ぎません。新しいGatedAdamWには、各更新をチェックする「スマートなゲート」があります。もし更新が小さすぎる(ささやき声のような)場合、門番は優しく「今日はダメだ」と言ってブロックします。もし更新が叫び声(重要な変化)であれば、ゲートは大きく開きます。これにより、ロボットが小さくて無益な調整にエネルギーを浪費するのを防ぎ、大きく重要な変化に集中できるようになります。
4. 「角度ステップキャップ」(安全なリード)
ロボットは球体の上を歩いているため、大きすぎるステップを踏むと、制御不能になって回転したり、世界の反対側へ飛び出したりする可能性があります。著者たちは、安全なリードのような「角度ステップキャップ」を追加しました。もしロボットが大きすぎるステップを取ろうとした場合、リードが優しく引き戻し、安全で小さな角度に保ちます。これにより、ロボットが荒っぽい危険な跳躍をすることがなくなり、その旅路はスムーズで安定したものになります。
結果:より効率的な学習
チームは、この新しいレシピを、10億から140億のパラメータ(ロボットの「脳のサイズ」)に及ぶ一連のAIモデルに対してテストしました。彼らは、古い方法でトレーニングされた標準的な「GPT」モデルと、彼らの新しい「nGPT」モデルを比較しました。
結果は印象的でした。新しいnGPTモデルは、標準的なモデルよりも一貫して低いエラー率(検証損失として測定)を達成しました。具体的には、140億パラメータのnGPTモデルは、標準的な140億モデルと同じ習熟度に達しましたが、そこに到達するために必要な「トレーニングトークン」(モデルが読み取るテキストの量)は約半分で済みました。言い換えれば、同じ目的地に到達するために、nGPTモデルは標準的なモデルと比較して、約半分の量のテキストを読むだけでよかったのです。
論文は、この改善が、単一のトリックではなく、これらすべての新しいルールが組み合わさって機能していることによるものであることを示唆しています。彼らはまた、「スマートゲート」の特定のセッティング(鋭さパラメータ と呼ばれるもの)についてもテストを行い、 のような柔らかいゲートの方が、厳格なものよりもわずかに効果的であることを発見しましたが、最大の勝利はゲートそのものではなく、新しいトレーニングシステム全体からもたらされたものです。
これが意味すること
著者たちは、自分たちがこれらのルールのあらゆる可能性を試したわけではない(完全なアブレーション研究を行ったわけではない)ため、まだ見つかっていないより良い設定があるかもしれないと注意深く述べています。しかし、彼らが見出した結果は確かなものです。AIに完璧な球体の上を歩かせ、よりスマートで制御された方法でステップを踏ませることで、これらの大規模なモデルを、大幅に少ないデータと時間でより賢く教えることができるのです。これは、私たちはインターネットのすべてを食べさせる必要はなく、その中からより効率的な部分だけを取り出すことで、より優れたAIを構築できるということを示唆する、実用的なレシピなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。