← 最新の論文
💬 NLP

Can LLMs Truly Forget? Revealing Unlearning Gaps Through Adversarial Evaluation

本論文は、機械学習における忘却(machine unlearning)において、標準的なクリーンクエリ指標と敵対的堅牢性の間に重大な乖離があることを明らかにしており、ファインチューニング手法が従来の評価下ではデータの忘却に成功しているように見えても、戦略的なプロンプティングを通じて標的となる情報が高度に復元可能であることを示し、それによって真の忘却を保証するための敵対的なストレス・テストの決定的な必要性を強調している。

原著者: Ayush Gupta, Hima Varshini Surisetty, Sreevidya Bollineni, Varad Ingale, Tuhina Tripathi, Abhishek Lalwani, Somya Chatterjee, Sadid Hasan

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Ayush Gupta, Hima Varshini Surisetty, Sreevidya Bollineni, Varad Ingale, Tuhina Tripathi, Abhishek Lalwani, Somya Chatterjee, Sadid Hasan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あらゆる本が人類の知識の総和を含んでいるが、中には消去しなければならない秘密(個人の住所、時代遅れの医学的助言、あるいは独自の処方箋など)が記されたページがある、そんな図書館を想像してみてください。デジタル世界において、人工知能システムはこれら膨大なテキストのコレクションによって訓練された、いわば巨大な図書館として機能します。ユーザーがコンピュータに対して特定の情報を「忘れる」よう求めたとき、目標はそのデータを徹底的に取り除き、マシンが他のことはすべて覚えていながらも、その特定の事実を思い出せないようにすることです。「機械学習からの忘却(マシン・アンラーニング)」として知られるこのプロセスは、プライバシーと安全のために不可欠です。しかし、ある疑念が研究者たちを悩ませ続けてきました。もしコンピュータが何かを忘れたと言ったとしても、それを本当に信頼できるのだろうか? それとも、情報は単に隠されているだけで、巧妙な質問によって掘り起こされるのを待っているだけなのだろうか?

マサチューセッツ大学アマースト校とマイクロソフト社の研究チームは、これらのデジタル図書館が実際にどれほどよく「忘れる」ことができるのか、その限界をテストすることで、この問いに答えようとしました。彼らは、指示に従い質問に答えるように訓練された特定の種類の人工知能モデルに焦点を当てました。チームは、忘却を測定するために用いられる標準的なテストが十分なのか、それとも決定的な弱点を見逃しているのではないかを確認したいと考えました。これを行うために、彼らは架空の著者伝記のデータセットを用いた制御された実験を作成しました。彼らはモデルにこれらの架空の著者について学習させた後、特定の著者を忘れさせる試みをしました。彼らは主に2つの方法をテストしました。一つは、質問の仕方を変えることで記憶を抑制しようとする方法であり、もう一つは、モデルの内部接続を実際に作り変えて記憶を消去する方法です。

研究者たちはまず、忘れるべき情報についてモデルに単純かつ直接的な質問を投げかける、標準的なテストを実行しました。このような穏やかで非敵対的な条件下では、いくつかの手法が完璧に機能しているように見えました。モデルは非常に高いスコアを記録し、ターゲットとなった事実が正常に消去されたことを示唆していました。ある手法は、特に情報の忘却がほぼ完全に完了したかのように見え、そのスコアは完全な成功を示していました。まるで、そのデータは永遠に消え去ったかのようでした。

しかし、チームはそこで止まりませんでした。モデルは単純な質問には抵抗できても、より複雑な質問には騙されてしまうのではないかと彼らは疑ったのです。これをテストするために、彼らは一連の戦略的な攻撃を開始しました。直接尋ねるのではなく、「ハッカー」プログラムを使用して、モデルの防御を突破するように設計された何百もの巧妙なプロンプトを生成しました。これらのプロンプメントには、モデルに専門家として振る舞うよう求めるロールプレイングのシナリオ、モデルの安全ルールを上書きしようとする指示、そして仮定的な、あるいは間接的な方法で構成された質問が含まれていました。また、言語が変わったときにモデルがミスをしないかどうかを確認するために、同じ質問を異なる言語で試行しました。

結果は、標準的なテストが示したものと、実際に起きていることとの間に、驚くべき隔たりがあることを明らかにしました。モデルは単純なテストでは満点を取っていましたが、戦略的な攻撃に対しては惨敗しました。研究者たちは、忘れたはずのモデルであっても、巧妙に誘導すれば情報を再び漏洩させてしまうことを発見しました。実際、これらの巧妙なプロンプトで攻撃された際、モデルは72パーセント以上の試行において秘密の情報を漏らしてしまいました。一部の手法においては、その失敗率は、一度も忘却の訓練を受けていないモデルの失敗率とほぼ同等でした。情報は消えていたのではなく、ただ眠っており、それを解錠するための適切な鍵を待っていただけだったのです。

チームはまた、質問の仕方が極めて重要であることも発見しました。直接的な質問は時に抵抗しやすい一方で、権威ある人物を演じさせたり、文章の完成を求めたり、あるいは要求を仮定のシナリオとして枠付けしたりするプロンプトは、モデルの記憶を打破する上ではるかに効果的でした。興味深いことに、研究者が単にドイツ語、スペイン語、日本語などの他の言語に質問を翻訳しただけの場合、モデルは情報の漏洩を3パーセント未満に抑え、はるかに高い耐性を示しました。これは、脆弱性が言語そのものにあるのではなく、質問に使用される「トリック」の特定の構造にあることを示唆しています。

研究結果の正確性を確保するため、チームは人間の専門家にモデルの回答のサンプルをレビューさせました。その結果、漏洩を判定するために使用された自動システムは、10件中7件のケースで人間の判断と一致しており、概ね正確であることが分かりました。自動システムは時として間違いを犯すこともありました(誤った回答を漏洩としてフラグ立てしたり、正しい回答を見逃したりするなど)。しかし、攻撃の成功率が高いことは実在する現象であり、テストソフトウェアの不具合ではないという信頼できるシグナルを提供していました。これにより、攻撃の成功率が高いことは現実のものであり、単なるシステムのバグではないことが確認されました。

本研究は、機械が何かを忘れたかどうかをテストする現在の方法は不十分であると結論付けています。モデルは標準的な成績表の上では完璧に見えることがあっても、執拗な攻撃者に対しては依然として危険なほど脆弱である可能性があります。研究者たちは、データが削除されたことを証明するために、単純でクリーンな質問に頼ることはできないと主張しています。代わりに、現実世界の攻撃者が用いるような、巧妙で戦略的な質問を用いて、これらのシステムをストレス・テストしなければなりません。モデルが秘密を漏らすように騙されないことを証明できない限り、それが真に忘れたと言い切ることはできません。「忘れたふり」と「実際に忘れること」の間の溝は依然として広く、その溝を埋めるには、これらの強力なデジタル・マインドを構築し、テストするための新しい方法が必要となるでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →