Muown: Row-Norm Control for Muon Optimization
本論文は、Muon におけるスペクトルノルムのドリフトを防止するために行ベクトルを明示的に制御するドロップインオプティマイザ「Muown」を導入し、これにより学習の安定性を向上させ、重み減衰に対する感度を低減し、さまざまなモデル規模にわたって優れたパープレキシティを達成することを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
巨大なデジタル脳(大規模言語モデル)を訓練して、物語を書かせたり、数学の問題を解かせたり、あなたとおしゃべりさせたりすると想像してみてください。これを行うために、その脳は回路内の数百万個の小さなノブ(重み)を調整しながら学習しなければなりません。
長らく、これらのノブを操作する最良の方法は、AdamWと呼ばれる手法でした。最近、Muonという新しい、より高速な手法が登場しました。それは自転車からスポーツカーに乗り換えるようなもので、より速く、より良く学習しました。しかし、欠点がありました。そのスポーツカーは、制御不能な速度で暴走する傾向があったのです。
問題:「漂流」するエンジン
この論文は、Muon に特有の問題を特定しています。モデルが訓練されるにつれて、内部接続の「大きさ」(具体的には、重み行列の行の強さ)が制御不能に成長し始めます。
これを風船を膨らませることに例えてみましょう。
- Muonは、風船をどの方向に膨らませるべきか(方向)を突き止めるのが得意です。
- しかし、必要以上に空気を送り込み続け、風船が破裂する(数値誤差)か不安定になるまで、どんどん大きくなってしまいます。
- 従来の解決策は、風船の周りに紐を巻き、大きくなりすぎたたびに引き締めること(重み減衰)でした。しかし、著者たちはこれを「ナットを割るのに金槌を使うようなもの」と指摘しました。これは学習プロセスを遅くするものでした。なぜなら、問題のない部分も含めて風船全体を締め付けてしまうからです。
診断:問題の二つの側面
Kai Lion 氏率いる著者たちは、実際に何が成長しているかを見るために、風船の中を調べようと決めました。彼らは、接続の「大きさ」が二つの明確な部分から成り立っていることに気づきました。
- 大きさ(Magnitute)(体積): 数字の行が全体的にどれくらい大きいか。
- 整合性(Coherence)(形状): その行内の数字が互いに対してどのように配置されているか。
彼らは発見しました。漂流して制御不能になっているのは大きさ(Magnitude)だけだということです。形状(整合性)は実際には完全に正常に機能し、安定していました。風船の形が変わっていたのではなく、単に大きくなっていたのです。
解決策:Muown(賢いポンプ)
著者たちは、Muownという新しいオプティマイザを作成しました。
接続全体を一つの大きな塊として扱うのではなく、Muown は作業を二つの独立したタスクに分割します。
- 方向チーム(Muon): このチームは、Muon が最も得意とすること、つまり重みを更新する最適な方向を突き止める仕事を引き続き行います。この部分は変更されません。
- 体積チーム(新規): これが新しい部分です。彼らは「大きさ(Magnitude)」(体積)を取り出し、それを独立した明示的な変数として扱います。そして、この体積が速くなりすぎないように、特別なルール(と呼ばれる特定の数学的幾何学)を与えます。
比喩:
あなたが運転している車において、ハンドルとアクセルペダルが固着していると想像してください。ハンドルを切ると、アクセルペダルも押されてしまい、車が制御不能に加速してしまいます。
- Muonは、そのような固着した車のようでした。
- Muownは、ハンドルからアクセルペダルの連結を解除したようなものです。あなたは依然として完璧に操縦できます(Muon のロジックを使用しますが)、アクセルペダル(大きさ)には、速度を必要な場所に正確に保ちつつ、速度を落とすことなく制御する、独立した賢いクルーズコントロールが備わっています。
結果
この論文は、1 億 2400 万パラメータの小型モデルから 27 億パラメータの超大型モデルまで、さまざまなモデルでこれをテストしました。彼らが発見したのは以下の通りです。
- 性能の向上: Muown は、Muon、AdamW、および他の競合他社よりも一貫して良い結果(モデルの混乱度を測る指標である「パープレキシティ」が低い)を生み出しました。
- 許容性の向上: Muon では、設定(学習率)に非常に注意を払う必要がありました。間違ったものを選べば、モデルは失敗しました。Muown ははるかに堅牢です。それは、運転の「スイートスポット」が広い車のように、幅広い設定範囲で機能します。
- 追加コストなし: 通常、新しい制御システムを追加すると、車の速度は低下します。しかし、著者たちはこの新しい「音量制御」をエンジンの既存のワークフローに直接統合したため、訓練プロセスにほとんど追加の時間を要しませんでした。
- 安定性: 「風船」の漂流は止まりました。スペクトルノルム(接続の大きさ)は安定し、元の Muon を悩ませていた数値誤差を防ぎました。
まとめ
この論文は、人気のある Muon オプティマイザの不安定性は、方向を見出す能力の欠陥ではなく、更新の「体積」に対する制御の欠如によるものであると主張しています。「体積」と「方向」を分離し、それぞれを異なる専門的なツールで制御することで、Muownは、重み減衰のような乱暴な修正を必要とすることなく、訓練を高速かつ安定したものに保ちます。これは、訓練プロセスをより滑らかで、速く、信頼性の高いものにする、そのまま導入可能な代替手段です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。