← 最新の論文
🤖 machine learning

Unforgettable Generalization in Language Models

本論文は、ランダム化されたラベルを用いたファインチューニングを通じて言語モデルがどのようにスキルを「忘却」するかを調査し、忘却の汎化が極めて予測困難かつタスク依存的であり、表層的にはランダムな出力を示すものの、多くの場合、特定の訓練例を超えては広がらないこと、そして線形プロービングによる成功が示す通り、潜在的なタスク能力は維持されていることを明らかにしている。

原著者: Eric Zhang, Leshem Choshen, Jacob Andreas

公開日 2026-08-06
📖 1 分で読めます☕ さくっと読める

原著者: Eric Zhang, Leshem Choshen, Jacob Andreas

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、インターネット上のほぼすべての情報を読み込んだ、超スマートなロボットの友達を持っています。そのロボットは詩を書いたり、数学の問題を解いたり、なぜ空が青いのかを教えてくれたりすることができます。しかし、時として、そのロボットはあなたが知ってほしくないことを学んでしまったり、特定のテクニックを使いすぎてしまい、それを「教え直して(消して)」ほしいと思うこともあります。これが「機械学習の忘却(マシン・アンラーニング)」の世界です。これは、人工知能研究の一分野であり、「ロボットに真の意味で忘れさせることはできるのか?」という非常に難しい問いを投げかけています。

この実験を理解するには、まず2つのことを知っておく必要があります。第一に、これらのロボット(大規模言語モデルと呼ばれます)は、膨大なテキストを読み込むことで学習し、その後、科学の質問に答えるといった特定の仕事に習熟するために、特定の例を用いて「微調整(ファインチューニング)」されます。第二に、これらを忘れさせるための一般的な方法の一つは、同じ質問を何度も提示する代わりに、答えを完全にバラバラにしたり、デタラメなものにしたりすることです。ロボットを十分に混乱させれば、そのトピック自体を完全に諦めてしまうのではないか、という考えに基づいています。研究者たちが追い続けている大きな謎は、「この混乱は広がるのか?」ということです。一つの特定の質問についてロボットを混乱させたとき、似たような質問すべてへの答え方を忘れてしまうのでしょうか、それとも、その特定の例についてだけ混乱するのでしょうか?


「再学習」の大実験

この論文において、MITのエリック・チャン、レシェム・チョーシェン、ジェイコブ・アンドレアスの研究者たちは、Llama2という巨大な言語モデルを使って「忘却」のゲームを行うことにしました。彼らはこのモデルを、テストで満点を取ったばかりの学生に見立て、ランダムで無意味な答えを再学習させることで、その教材を忘れさせようと試みました。彼らが知りたかったのは、その学生が主題全体を忘れてしまうのか、それとも見せられた特定の練習問題だけを忘れるのか、ということでした。

驚きの結果:対象によって異なる
研究者たちは、これを「物理的な常識」(どちらの物体が重いかを見分けるなど)から「含意(エンテイメント)」(ある文章が論理的に別の文章を導くかどうかを判断すること)に至るまで、21種類の異なるタスクでテストしました。その結果は、予測不能で驚くべきものでした。

時には、忘却は完璧に機能しました。もしモデルに「含意分類」(文章に関する論理パズル)の方法を忘れさせようとした場合、モデルは空白の状態になりました。モデルは、見たこともない新しい質問に対して、ランダムで役に立たない回答を出し始めました。それはまるで、ロボットがその特定の種類の論理を行う能力そのものを失ってしまったかのようでした。

しかし一方で、忘却が完全に失敗することもありました。モデルに「物理的な常識」(重力がどのように働くかなど)や「科学の質問」を忘れさせようとしても、モデルは頑固でした。ランダムで間違った答えで学習させた後でも、モデルは新しい科学の質問に対して依然として正しく回答していたのです!それは、特定の練習テストに対して間違った答えを暗記させられた学生が、本番のテストでは依然として正しい答えを知っているような状態でした。モデルは、学習させられた特定の例については忘れたようでしたが、一般的な知識は保持していたのです。

難易度の問題ではない
モデルは簡単なことは忘れ、難しいことは覚えているのだと思うかもしれません。研究者たちはこれを検証しましたが、実はそうではありませんでした。難易度がモデルの忘却を予測するわけではないことが分かりました。例えば、モデルは「ARC Easy」の質問よりも、「ARC Challenge」の「難しい」質問に対して、より正確に回答を保持していました。どちらも科学に関する質問ですが、難易度は関係なく、質問の「種類」が重要だったのです。

秘密の手がかり:自信と「脳」の変動性
では、何がスキルを忘れやすく、あるいは覚えやすくさせているのでしょうか?研究者たちは、モデルの内部データ表現(いわゆる「脳」)の中に隠された2つの手がかりを見つけました。

  1. 自信(Confidence): 忘却実験を開始する前に、モデルがすでにその答えに対して確信を持っていなかった(自信がなかった)場合、そのスキルを忘れさせるのは容易でした。逆に、モデルが自信を持っていた場合、その知識を強く保持していました。
  2. 脳の変動性(Brain Variability): これは、モデルの「思考の揺らぎ」を見ることに似ています。モデルの内部的な「思考(表現)」がバラバラであった場合(高変動性)、それは消去するのが困難でした。一方で、思考が非常に一貫しており、似通っていた場合(低変動性)、モデルは「アンラーニング」が容易でした。

「浅い」忘却
最も衝撃的な部分はここにあります。モデルがスキルを忘れたように見えたとき(つまり、誰に対してもランダムな回答をしているとき)でも、研究者たちは、情報は実際には消えていないことを発見しました。彼らは「線形プローブ(linear probe)」と呼ばれる単純なツール(非常に特化した検出器のようなもの)を構築し、モデルの内部的な「脳波」を調べました。

驚くべきことに、この検出器は、モデル自身が何も知らないかのように振る舞っているときでも、正しい答えを完璧に読み取ることができました。それは、クラスで混乱したふりをしてランダムな答えを出している学生が、もしそのノートを覗き見れば、正しい答えが完璧な筆跡で書かれているようなものです。「忘却」は表面的な演技に過ぎず、深い知識はそこに存在し、いつでも見つけ出せる状態で残っていたのです。

結論
この論文は、単にランダムな答えで再学習させることでAIに特定のスキルを忘れさせることは、一種のギャンブルであると結論付けています。それは一部のタスク(論理パズルなど)には機能しますが、他のタスク(科学や常識など)では失敗します。さらに、たとえ成功しているように見えても、情報は真に削除されているわけではなく、混乱という層の背後に隠されているだけなのです。研究者たちは、私たちが望まないことをモデルに確実に忘れさせるためには、これらのモデルがどのように情報を学習し、保存しているのかについて、もっと深く理解する必要があると示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →