← 最新の論文
🤖 machine learning

Natively Unlearnable Large Language Models

本論文は、共有されたバックボーン・ニューロンと疎に活性化されるソース固有のシンク(sink)を用いることで、共同学習の利点と一般的な言語能力を維持しつつ、個々の学習ソースの効率的かつ堅牢でデータフリーなアンラーニング(学習解除)を可能にするモデルアーキテクチャであるNULLs(Natively Unlearnable LLMs)を提案する。

原著者: Gaurav R. Ghosal, Pratyush Maini, Aditi Raghunathan

公開日 2026-06-15
📖 1 分で読めます☕ さくっと読める

原著者: Gaurav R. Ghosal, Pratyush Maini, Aditi Raghunathan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大な脳(大規模言語モデル)の中に、膨大な知識の図書館を構築しているところを想像してみてください。通常、この脳に教え込む際、すべてを混ぜ合わせてしまいます。もし「ハリー・ポッター」に関する事実と「第二次世界大戦」に関する事実を同時に教えると、それらの記憶は同じニューロンの中に絡み合ってしまいます。もし後で、法的要請によって「ハリー・ポッター」の記憶を削除しなければならなくなった場合、それはセーターから一本の糸を抜き取ろうとするようなものです。糸を抜こうとして、セーター全体を解いてしまうかもしれませんし、あるいはハリー・ポッターの記憶が再び忍び込んでくるかもしれません。

この論文は、NULLs(Natively Unlearnable LLMs:ネイティブに学習解除可能な大規模言語モデル)と呼ばれる、新しいAIの脳の作り方を提案しています。すべてを一つの大きな塊として混ぜるのではなく、NULLsは最初から特別な「仕分けシステム」を備えた脳を構築します。

その仕組みを、簡単な比喩を使って説明します。

1. 「共有キッチン」 vs 「個人用ロッカー」

AIの脳には、2種類のストレージ(記憶領域)があると考えてください。

  • 共有キッチン(バックボーン): ここでは、文法や文章の構成方法、あるいは世界の一般的な事実(例:「パリはフランスにある」)など、あらゆることに共通して適用される一般的なことを学習します。誰もがこのキッチンを使用します。
  • 個人用ロッカー(シンク): これが新しい発明です。特定の情報源(例えば、単一のWikipediaの記事や特定の書籍など)ごとに、AIにはその情報源だけが使用できる独自の「ロッカー」(ニューロン)が与えられます。

AIが、ある特定の記事に固有の事実(例:あるニュース記事における特定の内部告発者の名前)を学習すると、その事実は自然とその記事専用の個人用ロッカーに保存されます。一方で、一般的な事実(例:「内部告発者は重要である」)を学習した場合は、それが共有キッチンに送られます。

2. マジックスイッチ(学習解除)

標準的なAIでは、何かを忘れさせたい場合、脳全体を再学習させるか、重みを外科的に除去しようとする必要がありますが、これは多くの場合、他の機能を壊してしまいます。

NULLsでは、「学習解除」は照明のスイッチを切るのと同じくらい簡単です。

  • もし出版社から「私たちのモデルからその特定の記事を削除してください」と言われた場合、モデルを再学習させる必要はありません。ただ、その記事に割り当てられた「個人用ロロッカー」を無効にするだけです。
  • AIは、その記事の固有の事実を即座に忘れます。なぜなら、そのロッカーがロックされたからです。
  • しかし、共有キッチンは開いたままです。AIは、そのトピックに関する一般的な知識を保持しています。なぜなら、それらは共通のエリアに保存されており、特定のロッカーには入っていないからです。

これは、共有のリビングルームと、ゲストごとの個室がある家のようなものです。ゲストが去る時、あなたは単に彼らの部屋のドアをロックするだけです。リビングルーム(みんなが集まる場所)は全く変わらず、家が崩壊することはありません。

3. 論文で判明したこと

研究者たちは、主に2つの方法でこのアイデアをテストしました。

  • Wikipediaテスト(細粒度): 彼らは600万件のWikipedia記事を用いてモデルを訓練しました。彼らは、似たような記事に含まれる一般的な知識を削除することなく、たった一つの記事だけを削除できるかどうかを確認したいと考えました。
    • 結果: ある記事のロッカーを「ロック」したとき、モデルはその記事固有の詳細事項は忘れましたが、他の記事と共有されている一般的な知識は保持していました。これは、記事を破棄してゼロからモデルを再学習させた場合(通常、これは非常にコストがかかります)とほぼ同等の成果でした。
  • ハリー・ポッターテスト(粗粒度): 彼らはハリー・ポッターの全シリーズを用いてモデルを訓練し、その後、ハリー・ポッターに関する知識をすべて削除しようと試みました。
    • 結果: 「ハリー・ポッターのロッカー」をオフにすると、モデルは魔法使いについて話すのをやめ、ハリー・ポッターに関連する文章に対して、普通の事柄(市議会の会議など)について話し始めました。
    • ボーナス: 彼らは、敵対的なプロンプトや、少し再学習させることで、モデルにハリー・ポッターを思い出させるよう仕掛けました。標準的なAIモデルは失敗し、すぐに本の内容を思い出してしまいました。しかし、NULLsモデルは「学習解除」された状態を維持し、これらのトリックに抵抗しました。

4. AIはバカになるのか?

大きな懸念は、記憶を分離してしまうことで、AIの一般的な能力が低下するのではないかということです。彼らは標準的な言語ベンチマーク(科学の質問に答えたり、論理パズルを解いたりするもの)を用いて、NULLsモデルをテストしました。

  • 結果: NULLsモデルは、標準的な特化されていないAIと同等のパフォーマンスを発揮しました。一般的な知能を失うことはありませんでした。

まとめ

この論文は、AIの学習が終わった後に、どうやってデータを削除するかを考えるのではなく、設計段階から「削除ボタン」をアーキテクチャに組み込むべきだと主張しています。すべてのデータソースに専用の「ロッカー」を与えつつ、共通の「キッチン」を共有することで、モデルの他の部分を壊したり、すべてを最初からやり直したりすることなく、特定の情報を外科的に取り除くことができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →