Post-Grokking Collapse at the Representation-Readout Interface in Muon-Trained Transformers
本論文は、Muonで訓練されたトランスフォーマーが、表現と読み出しのインターフェースにおける不安定性に起因して、剰余演算の学習後に汎化が失敗する「ポスト・グロッキング崩壊(post-grokking collapse)」を示すことを実証しており、この現象は発散的なオプティマイザのダイナミクスとマスキング効果によって特徴付けられ、特定のモデル構成要素を凍結するか、タスクに整合した回路を再スケーリングすることによって解決可能である。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ロボットに非常に特殊な数学パズルを解く方法を教えているところだと想像してください。そのパズルとは、2つの数字を足し合わせ、それを大きな素数で割った余りを求めるというものです。最初は、ロボットは単に答えを暗記しているだけのように見えます。まるで暗記カードを使って詰め込み学習をしている学生のようです。しかし、ある時、「グロッキング(grokking)」と呼ばれる魔法のようなことが起こります。長い間進歩がないように見えた後、ロボットは突然、暗記をやめてパターンを「理解」します。ロボットは見たこともない数字に対しても、完璧に解くことができるようになるのです。これは、人工知能がどのようにして単なる暗記ではなく「思考」を学ぶのかを理解しようとしている科学者にとって、非常に重要なことです。
しかし、一つ落とし穴があります。時として、ロボットが解法を理解した後、同じパズルで訓練を続けているにもかかわらず、再び忘れてしまうことがあるのです。これは、アルジェブラ(代数学)をようやく理解した学生が、以前解けたはずの問題に対して、また初歩的なミスをし始めるようなものです。科学者たちは、ロボットの「脳」の内部で何が起きているのかを見るために、特別なツールを使用します。彼らは、ロボットが問題を解くために使用している特定のパターン(歌の中の音符のようなもの)を調べ、ロボットがまだ正しい音符を使っているかどうかを確認します。大きな疑問は、「なぜロボットは忘れるのか?」ということです。それは、ロボットが音符を学ぶのをやめてしまったからでしょうか? それとも、何か別のことが起きているのでしょうか?
消えゆく天才の謎
この研究では、モジュラー加算パズルを解くように訓練された、トランスフォーマーと呼ばれる特殊なAIロボットを調査しました。研究者たちは、ロボットに教えるために2種類の「教師(オプティマイザ)」を用いました。一方は、標準的で信頼できるインストラクターであるAdamWです。もう一方は、より新しく、より速い教師であり、ロボットがパズルを理解するのをより迅速に助けると思われるMuonです。
研究者たちは、Muonがまさにスピードの鬼であることを発見しました。Muonは、AdamWが時間をかける約半分の時間で、ロボットが「アハ体験(理解の瞬間)」に到達するのを助けます。しかし、ここにひねりがあります。Muonが見つけ出した解法は、信じられないほど脆弱なのです。一度ロボットがパズルを解くと、精度が100%からほぼゼロへと急落し、その後また回復するという現象が頻繁に起こります。これは、ロボットが同じ問題で訓練されている最中であっても、何度も繰り返されます。AdamWも完全に安全というわけではありませんが、失敗の頻度は低く、程度もそれほど深刻ではありません。
壊れた握手
では、何が間違っているのでしょうか? 研究者たちは、問題はロボットが数学を忘れていることではないことを突き止めました。ロボットの「脳」の中には、依然として正解が存在しています。問題は、ロボットの2つの部分の間にある**「壊れた握手」**です。それは、「考える」部分(表現)と「答える」部分(読み出し)の間の握手です。
ロボットの脳を、本がたくさん詰まった図書館(思考)であり、ロボットの口を、その本を音読する司書(答え)だと想像してください。
- 図書館(隠れ層)は、更新されるたびに本に新しいメモを書き込んでいます。
- 司書(出力ヘッド)は、答えを出すためにそれらの本を読もうとしています。
Muonという教師を使うと、図書館は更新されるたびに、少しずつ異なる言語で本を書き換えていきますが、司書は常に古い言語でそれらを読もうとします。最初は、両者は互いに理解し合うことができます。しかし、図書館が司書が適応できる速度よりも速く言語を変化させてしまうため、最終的に二人は理解し合えなくなります。図書館は依然として正しい数学を書いていますが、司書は間違った言葉を読んでいるのです。
研究者たちは、片方を凍結させることでこれを証明しました。図書館が言語を変えるのを止めると、ロボブルットは完璧な状態を維持しました。司書が読み方のスタイルを変えるのを止めた場合も、ロボットは完璧でした。しかし、両者が自由に動ける状態にすると、二人は互いに離れてしまい、ロボットは失敗し始めました。
機械の中の幽霊
ここが最も混乱する部分です。ロボットが失敗しているときでさえ、「図書館」には依然として完璧な解法が含まれています。研究者たちは、数学を知っている部分だけを見るための特別なフィルターを使用しました。その結果、解法は100%正しいままでした!
結局のところ、ロボットは**「回路マスキング(circuit masking)」**に苦しんでいるのです。図書館が正しい答えを叫んでいるのに、ロボットの他の部分が全く同じ音量で間違った答えを叫んでいる状況を想像してください。司書は、混濁した騒音を聞いてしまい、間違った答えを出してしまいます。正しい答えはそこにありますが、ノイズにかき消されているのです。
研究者たちは、他の何一つ変えずに、正しい部分(数学のファミリー)のボリュームを上げるだけで、ロボットは即座に100%の精度に戻ることを示しました。数学が消えたのではなく、ノイズの中に紛れ込んでいただけだったのです。
標準的なツールが見逃した理由
通常、科学者はロボットが機能しているかどうかを判断するために、問題を解くために使用している「音符」を確認します。彼らは、正しい音符が存在しているか、そしてそれが十分に大きいかを確認します。この研究において、それらのツールはロボットは正常であると判定しました。音符はそこにあり、失敗する前とほとんど同じように聞こえていました。
しかし、ロボットはそれでも失敗していました。これは、ツールが「音符」を見てはいたものの、司書が使っている「音量」や「言語」を見ていなかったからです。音符は完璧でしたが、司書がそれを正しく聴くことをやめていたのです。それは、ラジオをチェックして、放送がクリアに届いていることは確認できたものの、ラジオが間違った周波数にチューニングされていることに気づいていないようなものです。
深層へのダイブ
研究者たちはまた、ロボットをより「深く(思考の層を追加)」した場合に何が起こるかもテストしました。彼らは、Muonが学習速度をさらに加速させる一方で、「壊れた握手」の問題が悪化することを発見しました。より深いモデルでは、ロボットの脳は一箇所で数学を書き込みますが、答えを読み取る部分は別のセクションにあり、それらがより早く乖離してしまうのです。
彼らはまた、特殊な「正規化(normalization)」のトリック(更新を安定させる方法)を取り除くことで、Muonという教師を修正する試みも行いました。このトリックがない場合、ロボットは非常に狭く集中した形で数学を学習しますが、最終的には完全にクラッシュし、回復できなくなりました。これは、特殊なトリックが、ロボットが速く学習し知識を広める助けになる一方で、この特定の種類のリズムの狂いによる失敗(ドリフトによる失敗)に対して、より脆弱にさせることを示唆しています。
まとめ
この論文からの主な教訓は、ロボットの各パーツが同期していない場合、速く学ぶことは危険であるということです。ロボットは数学を忘れたのではありません。数学を知っている部分と、それを話す部分との間の接続を失っただけなのです。
研究者たちは、ロボットが解法を学んだ後に「話す」部分(出力と埋め込み)を凍結させると、ロボットは安定し、決して忘れないことを発見しました。これは、不安定さの原因がロボットの数学的能力にあるのではなく、二つの半分(思考と発話)が異なる速度で動き、共通の言語を見失っていることにあることを示唆しています。
要するに、ロボットは天才なのですが、脳と言葉が異なる方言を話しているために、突然吃音(どもり)が出始めている状態なのです。数学は内部では完璧ですが、それらの方言を一致させる方法がなければ、その天才はスキルを発揮することができません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。