J-space Forecasts Model Collapse, but Only Anchoring the Function Prevents It
合成データを用いた再帰的な学習は、J空間表現の部分空間におけるグローバルなドリフトとして現れるモデル崩壊を引き起こすが、本研究では、この幾何学的構造を安定化させることは効果的ではない一方で、少数の実データシーケンスを用いてモデルの入出力関数を崩壊前の状態に固定することが、ほぼすべての損傷を防ぐことに成功するという知見が得られた。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
言語モデルとして知られる人工知能システムは、物語を書いたり、質問に答えたり、人間のような会話を模倣したりすることができ、ますます一般的になりつつある。これらのシステムは、インターネットや書籍から膨大な量のテキストを読み取ることで学習する。しかし、厄介な現象が現れている。もしこれらのモデルが、自分自身で書き出したテキストを用いて学習した場合、劣化が始まるのである。このプロセスは「モデル崩壊(model collapse)」と呼ばれ、AIが人間の言語の全領域を理解する能力を失わせる原因となる。多様で微細なニュアクションを持つ応答を生み出す代わりに、モデルは同じことを繰り返し始め、最も一般的なフレーズに集中し、最終的には言語を豊かにしている希少で複雑な概念を忘れてしまう。インターネット上のコンテンツの多くがAIによって生成されるようになるにつれ、将来のモデルが意図せずこの劣化した出力から学習してしまい、知能がゆっくりと侵食していくフィードバックループが生じる可能性があるため、この危険は現実的なものである。
長年、科学者たちはモデルの最終的な出力を見て、テキストの質が低下していく様子を観察することで、この崩壊を確認してきた。しかし、独立した研究者であるChaeWoo Sonによる新しい研究は、より深い問いを投げかけている。すなわち、損傷は機械の内部のどこで起きているのか、という問いである。損傷はモデルが概念を表現する方法において起きているのか、それとも、次に何を言うかを決定する方法において起きているのだろうか。これを知るために、研究者は小さな言語モデルを用いた制御実験を構築し、数世代にわたって自身の合成テキストから学習するように強制した。目的は、損傷が発生する過程を追跡し、モデルの特定の内部構造を保護することによって、その損傷を止めることができるかどうかを確認することであった。
研究は、モデルを大量の人間による実際の文章で学習させることから始まった。モデルの準備が整うと、研究者はサイクルを開始した。モデルが自ら100万語を生成し、次にその新しいテキストを用いて再学習を行う。このプロセスが6回繰り返された。予想通り、モデルの実際の人間によるテキストに対する性能は非常に急速に悪化した。この自己学習をわずか1回行っただけで、文の次の単語を予測するモデルの能力は大幅に低下した。しかし、モデルの出力に失敗の兆候が現れる前に、研究者は機械の内部で別のことが起きていることに気づいた。モデルが概念を蓄積している特定の低次元空間を観察することで、研究者は、モデルの情報表現における大規模な変化を目撃した。この内部の変化は、外部から見て誰にも見える性能の低下よりも10倍速く起こった。
しかし、この早期警告信号は崩壊特有のものではなかった。モデルが自身の出力ではなく、新鮮で高品質な人間のテキストで学習した際も、同じ内部空間が移動したが、その動きははるかに小さく、一貫性に欠けるものであった。鍵となる違いは、変化の速度と深さであった。モデルが自身の質の低いデータから学習すると、内部の変化は巨大で一貫しており、モデルの理解を非常に低い底へと押し下げた。一方で、良質なデータから学習した際のシフトは軽微であった。このことは、内部空間がトラブルの敏感なバロメーターではあるものの、必ずしも損傷が加えられている場所そのものではないことを示唆していた。
これを検証するため、研究者は内部構造を固定することで崩壊を阻止しようと試みた。モデルが質の低い合成データから学習している間も、内部表現を学習開始時と全く同じ状態に保つよう強制したのである。これは、内部空間を安定させる上では完璧に機能したが、モデルを救うことには失敗した。モデルは依然として崩壊し、実際のテキストを扱う能力の大部分を失った。研究者がモデルの特定の空間だけでなく、層全体をロックしたとしても、その保護効果は最小限であった。これは極めて重要な発見であった。つまり、損傷はモデルがアイデアを保存する方法において起きているのではなく、他の場所で起きているということを証明したのである。
解決策は、研究者が「内部の地図」を保護する戦略から「振る舞い」を保護する戦略へと変更したときに得られた。モデルの内部構造を凍結させる代わりに、モデルに対し、一連の実際の人間による文章に対する予測を最初と同じに保つように強制するルールを追加した。これは、学生に対して「君が何を勉強しても構わないが、これらの特定の質問には依然として正しく答えられなければならない」と伝えるようなものである。このルールを適用したとき、モデルはほぼ完全に救われた。モデルは、人間のテキストを理解する能力を失うことなく、質の低い合成データから学習することができた。実際、この手法は、科学者がこの問題を解決するために用いる標準的な方法である「実際の人間による文章を学習データに混ぜ合わせる」方法よりもはるかに効果的であった。データの混合は問題の約半分しか防げなかったのに対し、振る舞いのルールはほぼすべての損傷を防いだのである。
この研究は、AIモデルの崩壊が、モデルの内部メモリや概念を保存する能力の失敗ではないことを明らかにしている。むしろ、それはモデルが見ているものと、モデルが何を言うと決定するかの間の「接続」の失敗である。損傷は、入力から出力へのマッピングである「関数」において発生しており、静的なアイデアの表現において発生しているのではない。この関数を健全な参照点に繋ぎ止めることで、モデルは自身の出力による汚染から守ることができる。この実験は小規模なモデルで行われたが、その知見は、将来のより大規模なシステムを保護するための強力かつ効率的な方法を示唆している。一握りの人間の実例を用いることでモデルの振る舞いを固定できれば、インターネットが機械生成のコンテンツで溢れかえったとしても、人工知能の緩やかな劣化を防ぐことが可能になるかもしれない。この研究は明確な道筋を提示している。モデルの内部状態を保存しようとするのではなく、現実の世界に対して正しく機能する能力を保存せよ、ということである。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。