← 最新の論文
🤖 machine learning

Forget Narrowly, Retain Broadly: Unlearning as an Asymmetric Generalization Problem

本論文は、現在の手法が特定の知識を確実に削除することなく、不注意に無関係な情報を消去してしまうという非対称な汎化の課題に対処するため、複雑な忘却・保持の境界を捉えた包括的なデータセットを提供し、最適なユーティリティのトレードオフを実現するためには、改良された訓練データがアルゴリズムの設計と同様に極めて重要であることを実証する、SUITE評価プロトコルおよびJensUn++アルゴリズムを導入するものである。

原著者: Amit Peleg, Naman Deep Singh, Naama Pearl, Bibhabasu Mohapatra, Matthias Hein

公開日 2026-07-13
📖 1 分で読めます☕ さくっと読める

原著者: Amit Peleg, Naman Deep Singh, Naama Pearl, Bibhabasu Mohapatra, Matthias Hein

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で超スマートな図書室ロボット「LLM」を想像してみてください。このロボットは、ほぼあらゆる事を知っています。時には、プライバシーや安全上の理由から、このロボットに特定の、例えばある有名なポップスターの法的なトラブルの詳細といった、恥ずかしい秘密を忘れてもらう必要があります。しかし、ここには落とし穴があります。あなたは、ロボットに他のすべてを忘れてほしくはないのです。ケーキの焼き方や、数学の問題を解く方法、宇宙について話すことは、そのポップスターについては話せなくなったとしても、引き続き覚えていてほしいのです。

問題は、ロボットが本当に秘密を忘れたかどうかを確認するために私たちが使ってきたテストが、ルールが仕組まれた「言葉当てゲーム」のようになっていることです。

2つの大きな間違い:アンダーフォーゲッティング(忘却不足)とオーバーフォーゲッティング(忘却過剰)

著者たちは、現在のテストには「アンダーフォーゲッティング(忘却不足)」と「オーバーフォーゲッティング(忘却過剰)」と呼ばれる2つの大きな欠陥があると考えています。

  1. アンダーフォーゲッティング(「言い換え」の罠): あなたがロボットに「そのポップスターの弁護士の名前を忘れなさい」と言ったとします。もしあなたが「誰が弁護士でしたか?」と尋ねれば、ロボットは「知りません」と言うかもしれません。しかし、「法的保護者の名前は何でしたか?」や「2007年にその歌手のために裁判を担当したのは誰ですか?」と尋ねると、ロボットは突然思い出すかもしれません!これは、ロボットが指示された「正確な文章」は忘れたものの、別の聞き方をすれば依然として秘密を知っている状態です。論文ではこれをアンダーフォーゲッティングと呼んでいます。ロボットは忘れたつもりになっていますが、適切な質問をされれば答えが出てくるよう、単に隠しているだけなのです。

  2. オーバーフォーゲッティング(「連鎖的な被害」の罠): 次に、あなたにそのポップスターのことを忘れるように命じたとします。パニックになったロボットは、「スター」、「音楽」、あるいは「裁判」に関連するすべてのことを忘れてしまうことに決めます。突然、別の歌手について話せなくなったり、法制度全般について話す方法さえ忘れてしまったりします。これは、カゴの中の腐ったリンゴを一つ取り除こうとして、誤ってカゴ全体を叩き潰してしまうようなものです。論文ではこれをオーバーフォーゲッティングと呼んでいます。ロボットは秘密に対してあまりに臆病になりすぎて、無関係で有用な知識まで破壊してしまうのです。

新しい解決策:SUITE(「厳格な先生」)

これを修正するために、著者たちはSUITE(Selective Unlearning of Isolated Topics and Events:孤立したトピックおよびイベントの選択的忘却)と呼ばれる、新しい、超厳格なテストキットを構築しました。SUITEを、単に同じ質問を繰り返すだけではない、厳格な先生だと考えてください。

  • 「忘れる」側については: 先生は、同じ秘密の質問を何十通りもの方法で投げかけます。直接的に聞いたり、逆方向に聞いたり(「どの歌手がこの弁護士を持っていましたか?」)、点と点を結びつける必要がある手がかりを用いた間接的な質問(マルチホップ推論)を行ったりします。もしロボットが一度でも滑って答えてしまったら、失敗です。
  • 「保持する」側については: 先生は、秘密と「ほぼ同じ」だが「完全には同じではない」事柄を、ロボットがまだ知っているかどうかをチェックします。例えば、秘密がスペースシャトル「チャレンジャー号」の事故に関するものであれば、先生はスペースシャトル「コロンビア号」の事故について、あるいは「チャレンジャー」という言葉を全く別の文脈(例えば深海溝など)で使用して質問します。これにより、ロボットが秘密に似たものをすべて誤って忘れてしまっていないかを確実にします。

論文によれば、彼らがこの厳格なSUITEテストを使用したところ、以前の手法は非常にうまくやっているように見えても、実際には惨めに失敗していることが明らかになりました。それらは、まだ秘密を覚えていた(アンダーフォーゲッティング)、あるいは他の部分の脳を壊してしまっていた(オーバーフォーゲッティング)のです。

新しいアルゴリズム:JensUn++(「丁寧な拒絶者」)

著者たちはまた、ロボットに忘れさせるための新しい方法、**JensUn++**も作成しました。

古い手法の多くは、答えを「抑制」しようと試みました。これは、ロボットが「知りません」と言うように強制されている状況ですが、強制されているために、ロボットがバグを起こして「空は緑で、数字は紫です」といったナンセンスな言葉を吐き出し始めるようなものです。これは危険であり、役に立ちません。

**JensUn++**は異なります。ロボットを沈黙させたり、バグらせたりするのではなく、丁寧で自然な拒絶を行うように訓練します。それは、ロボットに「残念ながら、この情報の検証はできません」と言って停止するように教えることです。それは、ロボットがパニックを起こすのではなく、穏やかな人間の声で「それはお答えできません」と言うように教えるようなものです。

論文では、**JensUn++**が以前の手法よりもはるかに優れていることが示されました。このテストでは、トリッキーな間接的質問に対しても、有用な知識を失うことなく、効果的に秘密を忘れさせることができました。

どれほど確かなのか?

著者たちは、単に推測したのではなく、測定したため、これらの結果に非常に自信を持っています。彼らは、この新しい手法(JensUn++)と新しいテストキット(SUITE)を、3つの異なる実世界のロボットの脳(Llama、Ministral、Qwen)でテストしました。

  • 彼らは、新しいトレーニングデータ(SUITE)を使用することで、彼ら自身のメソッドだけでなく、すべてのメソッドがより良く機能することを証明しました。
  • 彼らは、新しいメソッドであるJensUn++が、悪いことを忘れつつ、良いことを保持するという最高のバランスを実現したことを示しました。逐次設定(一つのトピックを次々と学習する設定)において、それは0%のナンセンスな回答を生み出しました。同時設定(すべてのトピックを一度に学習する設定)においては、わずか0.1%のナンセンスな回答であり、これは無視できるレベルです。
  • 彼らはさらに、ロボットを「敵対的」なトリック(異なる言語での質問やロールプレイなど)に対してテストしましたが、彼らの手法は依然として耐え抜きました。最高のモデルであるMistralは、同時設定において秘密を0%の確率で露呈させ、逐次設定では3%(最も厳格な敵対的条件下では4%に上昇)のみ露呈しました。対照的に、他の手法ははるかに成績が悪かったです。例えば、Llamaモデルの逐次設定において、GradDiffは秘密を38%、JensUnは**29%**の割合で露呈させていました。

要約すると、この論文は、単にロボットに「忘れなさい」と言って、うまくいくのを祈るだけでは不十分であることを示唆しています。本当に忘れたかどうかを確認するためには、トリッキーで多様な質問でテストする必要があり、また、壊れてしまうのではなく、丁寧に「ノー」と言うように訓練する必要があります。適切なデータと適切な手法があれば、ロボットの精神を失わせることなく、忘れるべきことを実際に忘れさせることができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →