Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining
本論文は、学習コーパスにおけるルールを支持する証拠の頻度がそのルールの生存を決定するという性質により、言語モデルが事前学習中に特定のルールを自発的に学習した後に突如として忘却するという現象である「自然なアングロッキング(natural ungrokking)」を導入するものである。これは、ルールを破壊することは容易であるが、それを復元することは不可能であるという非対称な制御によって特徴付けられるプロセスである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大きなアイデア:ルールを学び、そして忘れる
想像してみてください。あなたは非常に幼い子供(AIモデル)に、膨大な図書室の本(学習データ)を読み聞かせることで、言葉を教えています。
このプロセスの途中で、その子供は特定の文法ルールを突然理解します。**「もし文章の中で女性の名前(例えば『スー』)が出てきたら、次の代名詞は『she(彼女)』になる」**というルールです。子供はこのルールに非常に詳しくなります。もしあなたが「スーは……(Sue cried because...)」と問いかければ、子供は自信を持って「she」と答えます。
しかし、その後、奇妙なことが起こります。子供がさらに多くの本を読み進めるうちに、そのルールを完全に忘れてしまうのです。学習の終わりには、同じ質問をしても、彼らは(たとえそれが女性に対して不適切であっても、一般的に人々が使いがちな)「he(彼)」と推測してしまいます。
論文ではこれを**「ナチュラル・アングロッキング(Natural Ungrokking)」**と呼んでいます。これは「グロッキング(Grokking)」(モデルが何かを突然理解すること)の逆の現象です。ここでは、モデルがルールを学び、しばらくの間それを使用しますが、たとえ読んでいる本の中にそのルールが依然として存在しているとしても、静かにそのルールを捨て去ってしまうのです。
ミステリー:なぜ忘れてしまったのか?
通常、コンピュータモデルが何かを忘れるときは、データが変わったか、データが消えたときです。しかし、この実験では、データは決して変わっていませんでした。ルールは学習中ずっと、本の中に存在し続けていたのです。
研究者たちは、決定的な要因は頻度(ある事象がどれくらい頻繁に起こるか)であることを突き止めました。
- ルール: 「スー(Sue)」 「she(彼女)」
- 競合相手: 言語における一般的な習慣(人々がデフォルトの推測として「he」をよく使うこと)。
モデルが読んでいた特定の図書室では、「he」を使う習慣の方が、「スー she」というルールよりもはるかに多く出現していました。ルールはそこに存在していましたが、「he」の習慣があまりにも大きく、頻繁であったため、ルールをかき消してしまったのです。モデルはルールを「消去」したのではなく、ルールが負けてしまったために、ルールに耳を貸すのをやめただけなのです。
実験:一方通行の道
研究者たちは、これをコントロールできるかどうかを調べたいと考えました。彼らは学習データを、回すことができるダイヤルのように扱いました。
1. 「キル・スイッチ」(破壊は容易)
彼らは、ルールが強力に働いている図書室を用意し、データを反転させ始めました。つまり、「スー... she」というすべての箇所を「スー... he」へと書き換えたのです。
- 結果: データを反転させるほど、モデルはより速くルールを忘れました。それは「完璧」から「ゼロ」へと向かう、スムーズで予測可能な滑落でした。
- 比喩: もしあなたが学生に対して、本には「Y」と書いてあるのに、「いや、答えはXだ」と言い続けたら、学生はやがて本を信じるのをやめ、あなたを信じるようになるでしょう。
2. 「レスキュー・スイッチ」(復元は不可能)
次に、彼らは逆の試みを行いました。すでにルールを忘れてしまったモデル(「he」が多い図書室を読んでいたモデル)を取り出し、それを「救済」しようとしました。「スー... she」の例を、ルールを維持するために必要な量の300倍という膨大な量で、データの中に注入しました。
- 結果:: 何も起きませんでした。 モデルは依然としてルールを忘れたままでした。
- 比喩: 想像してみてください。ある教師が一年間ずっと「2+2=5」だと教えたために、すでに「2+2=5」を学んでしまった学生がいます。もしあなたが突然、彼に「2+2=4」と書かれた教科書を1,000冊渡したとしても、彼は混乱するかもしれませんが、学んだ「2+2=5」という習慣を解くことはできないかもしれません。ダメージはすでに受けているのです。彼の中の「経路」は舗装されてしまったのです。
「なぜ」:それは消去ではなく、置き換えである
研究者たちは、モデルの「脳」(内部の数学的構造)の内部を調べ、何が起きているのかを確認しました。
- 彼らは、モデルが文章構造を理解する能力を失ったわけではないことを発見しました。モデルは依然として単語を処理する方法を知っていました。
- 代わりに、内部の確信度がシフトしていました。モデルの内部的な「sheへの投票」は、「heへの投票」というより強いものによって圧倒されてしまったのです。
- これは法廷のようなものです。「she」という証拠はまだそこにありましたが、「he」という証拠があまりにも大きくなったため、裁判官(モデル)は「she」という証人の話を聞くのをやめてしまったのです。
まとめ
この論文は、AIの学習方法について主に3つのことを教えてくれます。
- 学習中の中間的なスキルは脆弱である: 学習の途中でモデルがルールを学んだからといって、それを保持し続けるとは限りません。
- 頻度がすべてを決める: ルールがデータの中で稀なものであれば、たとえそのルールが存在していても、より一般的な競合パターンによって押しつぶされる可能性が高いです。
- 壊すのは簡単だが、直すのは難しい: 一度、データの混合によってモデルがルールを忘れてしまうと、単に後からそのルールを戻すだけではうまくいかないことが多いのです。「忘却」はその特定の学習プロセスにおいて永続的なものとなります。
要約すると: AIモデルは、部屋の中で最も大きな声を聞く学生のようなものです。もし「間違った」声が「正しい」ルールよりも大きければ、学生は間違ったことを学びます。そして、一度間違ったことを学んでしまうと、後で正しいルールをいくら叫んでも、効果がないことが多いのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。