← 最新の論文
💬 NLP

Understanding Verbatim Memorization in LLMs Through Circuit Discovery

本論文は、メカニスティックな解釈可能性とトランスフォーマー回路の発見を用いて、LLMにおける逐語的な記憶の開始と維持がそれぞれ異なるニューラルサブグラフによって担われていることを明らかにし、開始は文脈依存的である一方で、防止メカニズムはドメインを越えて強固に転移することを提示する。

原著者: Ilya Lasy, Peter Knees, Stefan Woltran

公開日 2026-02-04
📖 1 分で読めます☕ さくっと読める

原著者: Ilya Lasy, Peter Knees, Stefan Woltran

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(LLM)を、これまでに書かれたあらゆる本が保管されている、巨大で超整理された図書館だと想像してみてください。時々、司書に質問をすると、司書は単に物語を要約するだけでなく、ある本の段落を言葉通りに暗唱することがあります。これを**記憶(メモライゼーション)**と呼びます。

あなたが共有した論文は、まさにその司書が「いつ」その本の暗唱を開始し、「どのように」それを継続するかを突き止めようとしている探偵チームのようなものです。彼らは単に推測するのではなく、「回路発見(circuit discovery)」と呼ばれる特別なツールを使用して、このタスクを処理する司書の脳内の特定の電気的な経路をマッピングしました。

以下に、彼らの発見を簡単な比喩を用いて解説します。

1. 2つの異なる役割:「開始スイッチ」と「トレッドミル」

研究者たちは、文章を記憶することは単一の大きな動作ではなく、実際には2つの明確なステップ、つまり「機械のスイッチを入れること」と「それを動かし続けること」であることに気づきました。

  • 「開始スイッチ」(記憶の決定): これは、モデルがプロンプトを見て、「おや、私はこの正確な文章を知っているぞ!よし、これをコピーしよう」と判断する瞬間です。
  • 「トレッドミル」(分岐比較): 一度モデルがコピーを開始すると、これはモデルが気を散らすことなく、言葉のひとつひとつを同じ経路に沿って進み続けられるようにするメカニズムです。

2. 探偵の仕事:微細な回路を見つける

これらのメカニズムを見つけ出すために、研究者たちは「間違い探し」のようなゲームを作成しました。彼らはモデルに、非常によく似た2つのプロンプトを与えました。

  • クリーンなプロンプト: 記憶された応答を誘発するまであと「一歩」のところにいる文章。
  • 破損したプロンプト: 見た目は似ているが、モデルを全く別の、記憶されていない回答へと導く文章。

これら2つのプロンプト間で「脳の活動(活性化)」を入れ替えることで、どの微細なワイヤ(回路)がスイッチを制御しているのかを確認できました。その結果、2つの驚くべき事実が判明しました。

  • 「開始スイッチ」はマスターコントローラーである: 記憶を開始する責任を持つ微細なワイヤのグループは、それを継続させるのに十分なほど強力です。もし「開始スイッチ」をいじってしまうと、モデルは記憶の再生を完全に停止します。
  • 「トレッドミル」は一方通行である: 一度モデルを記憶の経路に乗せた後に、その経路を維持する責任を持つワイヤは、それ単体ではプロセスを開始することができません。それらは、すでに走っている人がいなければ機能しないトレッドミルのようなものであり、自らエンジンを始動させることはできないのです。

3. 「ユニバーサル・ストップボタン」対「コンテキスト依存のスタートボタン」

研究者たちは、これらの回路が(Wikipediaだけでなく)コード、メール、ウェブページといった異なる種類のテキストでどのように機能するかをテストしました。

  • 「ユニバーサル・ストップボタン」: 記憶を防ぐ(モデルの暗唱を止める)回路は、どこでも機能しました。テキストがGitHubのコードであってもEnronのメールであっても、モデルの暗唱を止めるための同じ「ブレーキ」をかけることができました。
  • 「コンテキスト依存のスタートボタン」: 記憶を引き起こす回路は、非常に好みが分かれました。メールにおける記憶のトリガーとなるものが、必ずしもコードファイルにおける記憶のトリガーになるとは限りません。「開始」メカニズムは、テキストの種類に大きく依存しています。

4. 大きな教訓:トリガーを壊す方が、記憶を壊すよりも容易である

最も興味深い結論は、この挙動をどのように制御するかについてです。

研究者たちは、新しいことを記憶させる(強制的に記憶させる)よりも、**「開始スイッチ」を壊す(モデルが記憶することを決定するのを防ぐ)**方がはるかに簡単であることを発見しました。

彼らはこれを、セキュリティシステムを備えた家と比較しています。

  • 保存された情報(図書館の中の本)を変更したり消去したりすることは非常に困難です。
  • しかし、トリガー(図書館への扉を開ける鍵)は壊れやすいものです。もし鍵を細工すれば、図書館の中に本があったとしても、図書館はロックされたままになります。

要約すると: この論文は、もしAIがプライベートな情報や著作権のあるテキストを漏洩させるのを止めたいのであれば、記憶(メモリ)を削除しようとする(それは困難です)のではなく、特定の「トリガー回路」、つまりいつ暗唱を開始するかを決定する回路を見つけ出し、無効化することに焦点を当てるべきである、ということを示唆しています。なぜなら、それらは異なる種類のテキストにおいても機能する弱点だからです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →