← 最新の論文
🤖 machine learning

Subtract or Replay? Exact Deletion from Language-Model Memory

本論文は、言語モデルのメモリからの正確な削除が根本的にメモリ表現によって決定されることを示しており、アドレス指定可能な記録は代数的な減算によって除去できる一方で、絡み合った書き込みはビット単位での状態復元を実現するためにリプレイに基づく再構築を必要とする。

原著者: Vishwajith Ramesh

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Vishwajith Ramesh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。決して忘れることのない、超スマートなデジタルアシスタントを。あなたがある秘密を伝えると、そのアシスタントは脳内にある巨大で目に見えない図書館にその秘密を保存します。後になって、あなたが物語を書いたりアドバイスを求めたりすると、アシスタントはその秘密を取り出して役に立てようとします。しかし、もしあなたが気が変わったらどうでしょう?「実は、そんなことは言っていませんでした」とか、「それは間違いでした、消してください」と言ったら?現実の世界では、手紙を燃やせばその言葉は消えてなくなります。しかし、コンピュータの場合、単に「忘れて」と伝えるだけでは困難です。コンピュータは単にその秘密を奥深くに隠しているだけかもしれませんし、あるいはその秘密を使ってすでに脳の他の部分を構築してしまっており、他のすべてを壊すことなく「削除」することは不可能かもしれません。これが「機械学習の忘却(マシン・アンラーニング)」という問題です。科学者たちは、AIが単にふりをするのではなく、指示通りに特定のことを真に忘れさせる方法を見つけ出そうとしています。これはプライバシーにとって極めて重要なことで、あなたのデジタルライフにおける「忘れられる権利」を確保し、ロボットに記憶を消去するよう求めた場合、形跡を残さず、実際に記憶を消去できるようにすることを意味します。

「Subtract or Replay?(引き算か、リプレイか?)」と題されたこの論文は、この問題に取り組むにあたって、一つの単純な問いを投げかけています。「記憶はどのように保存されているのか?」。著者であるヴィシュワジット・ラメシュ氏らは、その答えはAIの記憶室の中にある「家具」に完全に依存していることを発見しました。彼らは、記憶を削除する方法には二つの全く異なる方法があり、適切な道具を選ばなければ失敗するということを突き止めたのです。

記憶を削除する二つの方法

この論文は、このアイデアを、二種類の異なるライブラリのように機能する二種類のAIモデルでテストしています。

1. 「アドレス指定可能」なライブラリ(Gemmaモデル)
すべての本に固有の棚番号があるライブラリを想像してください。本を削除したいときは、その棚に行って取り出すだけです。ライブラリ全体を再構築する必要はありません。
著者らはこれをGemmaというモデルでテストしました。彼らは、Gemmaの標準的なメモリの一部を、このようなアドレス指定可能なライブラリとして機能する特別なシステムに置き換えました。このシステムでは、すべての情報の断片には、AIの回答にどの程度影響を与えるかを制御する「係数」(音量調節つまみのようなものと考えてください)が存在します。

  • 魔法のトリック: 記憶を削除するために、彼らは単に音量つまみをゼロに回しました。これは「代数的な減算(algebraic decrement)」と呼ばれます。
  • 結果: これは完璧に機能しました。つまみを回すと、AIの出力は、最初からその記憶が存在しなかった場合と数学的に同一になりました。その差は極めて小さく(KLダイバージェンスで5.4 × 10⁻¹⁵)、ほぼゼロでした。
  • 落とし穴: これは小規模なモデル(10億パラメータ)ではうまく機能します。しかし、モデルが大きくなる(40億および120億パラメータ)につれて、この手法は乱雑でコストがかかるものとなり、AIのパフォーマンスをそれぞれ11.2%、**44.3%**低下させます。したがって、「つまみを回す」トリックは小さなライブラリには完璧ですが、巨大なライブラリのための万能な解決策ではありません。

2. 「織り込まれた」ライブラリ(Kimiモデル)
次に、本が棚に並んでいるのではない、別の種類のライブラリを想像してください。そこでは、すべての本のページが巨大な単一のタペストリーへと織り合わされています。もし一本の糸(記憶)を引き抜こうとすれば、タペストリー全体が動き、パターンが予測不可能な形で変化してしまいます。
著者らはこれを、タペストリーのようなメモリを使用する「再帰的状態(recurrent state)」を持つKimiというモデルでテストしました。ここでは、新しい情報が入るたびに、メモリの全状態が変化します。

  • 問題点: 彼らがGemmaで行ったように、単に記憶を「引き算」しようと試みたところ、失敗しました。メモリが織り込まれているため、一つの糸を取り除いても、単に穴が開くだけではなく、歪んだパターンが残ってしまうからです。数学的な検証によれば、削除された部分の後に続く内容に応じて、メモリの影響力の**12%から49%**が変化することが示されました。単に引き算することはできません。削除の「レシート(証跡)」がもはや有効ではなくなってしまうのです。
  • 解決策: 織り込まれたタペストリーから、パターンを台無しにすることなく糸を引き抜くことはできないため、作り直す必要があります。著者らは「チェックポイント・アンド・リプレイ」という手法を用いました。彼らは、望まない糸が織り込まれるのタペストリーのスナップショットを保存しました。そして、AIをそのスナップショットまで巻き戻し、その後の出来事をすべて「リプレイ(再生)」しましたが、その際、問題の糸をスキップしました。
  • 結果: これにより、完璧に機能しました。リプレイ後のAIのメモリは、悪い糸を見ることさえなかった場合のメモリと、ビット単位で完全に一致しました。彼らは最大18,842トークンに及ぶ実際の臨床ノートを用いてテストを行いましたが、毎回成功しました。また、悪い糸を良い糸に置き換えてからリプレイすることで、記録を完璧に「修正」することも可能にしました。

これがあなたにとって何を意味するか

この論文の主な結論は、「正確な削除」とは単一の魔法のボタンではないということです。それは、メモリがどのように構築されているかという特性に依存します。

  • もしメモリがすべての記録に対して明確なアドレスを保持しているなら(Gemmaの特別なセットアップのように)、素早く完璧に**「引き算(subtract)」**することができます。
  • もしメモリがすべてを織り合わせているなら(Kimiのタペストリーのように)、引き算はできません。保存されたチェックポイントから物語を**「再構築(rebuild)」**しなければなりません。

著者らは、自分たちが「発見しなかったこと」についても明確に述べています。単に記憶を「マスク」したり「抑制」したりする(AIにそれを無視するように命じる)だけでは不十分であることを彼らは証明しました。AIは依然として、隠れた方法でそれを「記憶」しており、攻撃者はしばしばそれを引き出すことができます。真の削除には、完璧な引き算か、あるいは完璧な再構築のどちらかが必要です。

要約すると、AIに真に何かを忘れさせたいのであれば、まずそのメモリの部屋を確認しなければなりません。それは棚のあるライブラリですか?ならば、つまみを回してください。それは織り込まれたタペストリーですか?ならば、巻き戻してリプレイしてください。近道はありませんが、今や私たちは、どの仕事に対してどの道具を使うべきかを正確に知っているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →