← 最新の論文
🤖 machine learning

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

本サーベイは、視覚、言語、音声、およびビデオのモダリティにわたるマルチモーダル・アンラーニングの手法、データセット、およびベンチマークに関する、統一されたシステム指向のタクソノミーを提示し、モデル全体の有用性を維持しながら、基盤モデルから機密情報や著作権情報を選択的に削除するという課題に対処するものである。

原著者: Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

公開日 2026-07-10
📖 1 分で読めます☕ さくっと読める

原著者: Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、絵を描いたり、物語を書いたり、歌を歌ったり、動画を作ったりすることを同時にこなせる、超スマートで超クリエイティブなロボットの友達を作ったと想像してみてください。このロボットはインターネット全体を読み込むことで学習しましたが、その過程で、本来覚えてはいけないことを誤って記憶してしまいました。例えば、隣人のプライベートな写真や、有名なアーティストによる著作権のある絵画、あるいは奇妙で不適切なジョークなどです。

そして、隣人はその写真を忘れさせてほしいと願い、アーティストは自分のスタイルを消去してほしいと願い、インターネットはあのジョークを消し去りたいと考えています。これまでの修正方法は、悪いデータを削除してロボットをゼロから作り直すことでした。しかし、それは壊れたレンガを一つ取り除くために摩天楼をすべて解体するようなものであり、膨大な時間がかかり、多額の費用がかかり、全く現実的ではありません。

この論文は、この新しい、よりスマートな解決策を探索するための大規模な**サーベイ(現在の状況を描いた巨大な地図)です。それがマルチモーダル・アンラーニング(Multimodal Unlearning)**です。ロボット全体を作り直す代わりに、これらの手法は「選択的な忘却」を実行しようとします。つまり、ロボットの描く、書く、歌うという能力を完璧に保ったまま、悪い記憶だけを外科手術のように精密に取り除くのです。

大きな地図:どこを切るのか?

著者らは、すべての異なる手法を「システム優先」の地図へと整理しています。単に数学的な側面を見るのではなく、ロボットの脳の「いつ」「どこで」介入するかを見ています。彼らは、この手術を行うための5つの主要な場所を見つけました。

  1. データ側(ロボットが学習する前): ロボットがそれを見る前に、悪い写真やテキストに「学習禁止」のステッカーを貼ることを想像してください。いくつかの手法は、ロボットがそれを記憶できないようにデータをわずかに調整したり、画像と単語の「毒された」ペアを取り除くために学習ライブラリをクリーンアップしたりします。
  2. 学習時の編集(ロボットが学習している間): これは、ロボットが勉強している最中に新しいルールを教えるようなものです。「おい、これ特定のものを目にしたら、それは覚えてはいけないが、他のことはすべて覚え続けておけ」と伝えます。ロボットは、他のことを保持しながら、ターゲットを忘れるように脳の重みを調整します。
  3. アーキテクチャの制約(ロボットのハードウェアを変更する): ルールを変える代わりに、ロボットの構造を変えることもあります。脳の特定の部分を「凍結(ロック)」して変更できないようにしたり、悪い記憶を保持している特定の接続を「プルーニング(剪定・切り落とし)」したりしてから、ロボットがその隙間の周囲で良いことを再学習できるようにします。
  4. 学習フリーのアンラーニング(魔法の消しゴム): これが最もクールな部分です。これらの手法は、ロボットを再学習させません。数学を用いて、ロボットの脳の重みや内部表現(物事についての「考え方」)を、ワンステップで直接編集します。これは、他のページには触れずに、特定の化学溶剤を使って特定の悪いインクだけを溶かすようなものです。
  5. デコーディング時(ショーの最中): ロボットが絵を描いているところを想像してください。画像が現れる直前の最後の瞬間に、フィルターが介入して、「いや、その特定の顔は描くな」と言います。ロボットの脳はそのままですが、出力が禁止されたコンテンツから逸らされます。

ゲームのルール

この論文は、これらの手法が何を達成しようとしており、何をしていないのかについて非常に明確に述べています。

  • 目標: 主な目標は選択的な除去です。特定の「忘却セット」(例:個人の顔や著作権のあるスタイル)を忘れさせつつ、「保持セット」(それ以外のすべて)が完璧に機能するようにしたいのです。論文ではこれを数学的に定義しています。忘却後のロボットは、悪いデータで訓練されていなかったかのように振る舞う必要があります。
  • 除外される考え方: 論文は、単にデータを削除するだけでロボットが自動的に忘れると期待することに対して、明確に反対しています。知識はロボットの脳全体に分散しているため、ソースファイルを削除しても記憶は消えないことを示しています。また、現在の手法が完璧であるという考えも否定しています。これらは、記憶が100%永遠に消えたという鉄壁の数学的証明に基づいているのではなく、多くの場合ヒューリスティック(試行錯誤と賢い推測に基づくもの)です。
  • 「アンラーニング」対「隠蔽」の罠: 論文は、一部の手法は真に削除しているのではなく、単に情報を隠しているだけかもしれないと示唆しています。適切な「敵対的(アドバーサリアル)」な質問(ジェイルブレイクのようなもの)を投げかけると、忘れられた記憶が再び飛び出してくるかもしれません。論文は、多くの手法はあるものの、記憶が完全に消去されたという保証はまだなく、特に巧妙な攻撃に対しては不十分であることを指摘していますいます。

ツールキット:データセットとベンチマーク

これらの手法をテストするために、研究者は特定の「訓練場」を使用します。論文では、使用される多くのデータセットを挙げています。

  • 顔に対して: 特定の人物の顔を忘れさせることができるかをテストするために、CelebA(202,599枚の画像)やVGGFace2(330万枚の顔画像)などのデータセットを使用します。
  • 著作権に対して: ロボットが特定のアーティストのスタイルを忘れられるかを確認するために、Uncanvas(60の芸術的スタイル)を使用します。
  • 安全性に対して: 不適切または不安全なコンテンツを生成する方法を忘れさせることができるかをテストするために、I2P(4,700のプロンプト)を使用します。
  • オーディオに対して: 特定の話し手の声を忘れさせることができるかをテストするために、VoxCeleb1(150,000の発話)を使用します。

論文では、これらの手法がどれほど上手くいっているかを測定するためのベンチマークMU-BenchMLLMU-Benchなど)についても強調しています。これらのベンチマークは、以下の3つをチェックします。

  1. 忘れたか?(ロボットはその悪いものを認識できなくなったか?)
  2. 良いものは維持されたか?(ロボットは依然として他のことについて描いたり書いたりするのが上手いか?)
  3. 安全か?(ハッカーが、悪いことを思い出させるようにロボットを騙すことができるか?)

現実的な検証:何がまだ壊れているのか?

著者らは、残されている課題についても正直に述べています。彼らは、私たちが素晴らしいツールを多く持っている一方で、まだ「初期段階」にいることを示唆しています。

  • 魔法の保証はない: ほとんどの手法はシミュレーションされたものか、特定のモデルに対してテストされたものです。「この手法を使えば、どんな場合でも、どんな方法でも、記憶を永遠に消去できる」という普遍的な数学的証明はまだありません。
    এটি
  • 「再浮上」の問題: 論文は、生成モデル(画像作成AIなど)において、忘れられた概念が、後に再学習(ファインチューニング)されたり、誰かが巧妙なプロンプトを使用したりすることで、再浮上する可能性があることを示唆しています。それは、ある曲を忘れたはずなのに、似たようなメロディを聞いたら思い出してしまうようなものです。
  • トレードオフ: 多くの場合、トレードオフが存在します。より積極的に忘れさせようとすればするほど、ロボットの他の能力を損なう可能性があります。論文は、ごくわずかなデータの削除であっても、他のタスクのパフォーマンスに測定可能な低下を引き起こすことがあると指摘しています。
  • クロスモダリティの漏洩(リーク): 画像における顔を忘れさせるように教えた場合、テキストによる記述からもその顔を忘れさせるのでしょうか?論文は、これが大きな未解決の課題であることを示唆しています。つまり、一つのモード(テキスト)での安全性が、必ずしも別のモード(画像)での安全性を保証するわけではないということです。

結論

この論文は、単一の新しい発明ではなく、現在存在するものを網羅したサーベイです。それは、「AIに忘れさせる方法」という混沌とした状況を、明確なシステムへと整理しています。私たちはAIモデルに対して「手術」を行う強力なツールを持っていますが、その手術をいかに100%信頼でき、ハッカーに対して安全で、かつロボットの脳の他の部分を傷つけない完璧なものにするかについては、まだ模索している段階です。

著者らは、(他の人々がその上に構築できるように)キュレートされたリポジトリ(コードとデータの公開コレクション)を公開しています。彼らは、問題を(より良いベンチマークやより強力な保証の必要性など)明らかにすることで、最終的には、誰かが「忘れさせてほしい」と頼むたびにゼロから作り直す必要のない、プライバシーや著作権を尊重するAIを構築できると希望しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →