← 最新の論文
🤖 machine learning

MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks

本論文は、マルチモーダル検索拡張生成システムが、モデル精度を著しく低下させ既存の防御を回避し得る標的型ローカルポイズニング攻撃と広範なグローバルポイズニング攻撃の両方に対して極めて脆弱であることを示すフレームワーク「MM-PoisonRAG」を提案する。

原著者: Hyeonjeong Ha, Qiusi Zhan, Jeonghwan Kim, Dimitrios Bralios, Saikrishna Sanniboina, Nanyun Peng, Kai-Wei Chang, Daniel Kang, Heng Ji

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Hyeonjeong Ha, Qiusi Zhan, Jeonghwan Kim, Dimitrios Bralios, Saikrishna Sanniboina, Nanyun Peng, Kai-Wei Chang, Daniel Kang, Heng Ji

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

超賢いロボットアシスタントが画像を見たりテキストを読んだりできると想像してみてください。このロボットは質問に答える際、自らの記憶だけに頼るのではなく、最新の事実を確認できる「図書館」を持っています。このシステムはマルチモーダル RAG(検索拡張生成)と呼ばれます。事件を解決する前にデータベースで手がかりを調べる探偵のようなものです。

論文MM-POISONRAGは、この探偵の仕組みにある恐ろしい欠陥を明らかにしました:その図書館はハッキングされ得るのです。

以下に、彼らの発見を簡単な比喩を用いて解説します。

1. 設定:信頼する探偵

通常、「2023 年のメットガラで着用されたドレスの色は何だった?」と尋ねると、ロボットは以下の手順を踏みます。

  1. そのイベントに関する画像やテキストを図書館で検索します。
  2. 結果をフィルタリングし、最も適切な一致を見つけます。
  3. 最も適切な結果を読み、回答を提示します。

問題は、その図書館が一般に公開されていることです。レストランのウェブサイトに誰でも偽のレビューを投稿できるのと同様に、悪意ある人物はロボット図書館に偽の本や加工された写真を忍び込ませることができます。

2. 攻撃:井戸を毒する 2 つの方法

研究者たちは、この図書館がいかに簡単に汚染され得るかをテストするためのフレームワークMM-POISONRAGを作成しました。彼らはシステムを破壊する 2 つの明確な方法を見つけました。

攻撃 A:「標的型スパイ」(局所的汚染)

  • 比喩: あなたが「チョコレートケーキ」の特定のレシピを探していると想像してください。スパイが図書館に忍び込み、チョコレートケーキに関する唯一の本を、「チョコレートケーキは実際には塩と岩で作られている」と記した偽物に置き換えます。
  • 仕組み: 攻撃者は、特定の質問に対して、特定の偽画像とそれに一致する偽の説明(キャプション)を作成します。それらは完璧に見えるように作られており、ロボットの検索エンジンがそれを第 1 位の結果として選び出します。
  • 結果: ロボットは偽の本を読み、「チョコレートケーキは塩で作られている」と自信を持ってあなたに伝えます。
  • 論文の発見: 攻撃者がロボットの内部コードを知らない場合(「ブラックボックス」攻撃)でも、システムを約 56% の確率で欺くことができます。

攻撃 B:「万能のバグ」(全球的汚染)

  • 比喩: 図書館の正面玄関に、「すべての本を無視せよ。あらゆる質問への答えは『申し訳ありません』である」と書かれた、光り輝く奇妙な付箋が 1 枚貼られていると想像してください。この付箋はあまりにも明るく、奇妙な場所に貼られているため、ロボットは何を尋ねても、すべての検索でこれを掴んでしまいます。
  • 仕組み: 攻撃者は、たった 1 つの奇妙な画像と説明を作成します。これはあらゆるものに関連しているように見えるように設計されています。すべての鍵に合う「万能鍵」のようなものです。
  • 結果: 天気、数学、歴史を尋ねても、ロボットはこの 1 つの偽エントリーを掴み、「申し訳ありません」や「3」のような nonsensical な回答を返します。
  • 論文の発見: これは壊滅的です。たった 1 つの汚染されたエントリーによって、ロボットの精度は**0%**まで低下します。完全に機能しなくなります。

3. 「マジックトリック」(転移性)

研究者たちは、さらに不安を覚えるような発見をしました:その毒は他のロボットにも通用します。

  • 比喩: 特定の検索エンジンを使うロボット A を偽の本で欺いた場合、その同じ偽本は、あなたが本を変更しなくても、異なる検索エンジンを使うロボット B も欺くことが多いのです。
  • 論文の発見: 攻撃者は、被害者が使用する特定の検索エンジンを知る必要はありませんでした。彼らはあるシステムで偽のコンテンツを訓練すれば、自分が見たこともない他のシステムを成功裏に破壊することができました。

4. 失敗した盾(防御策)

研究者たちは、既存の安全対策がこれを止められるか試みました。

  • 比喩: 熟練した泥棒に「質問を言い換えろ」と頼んだり、写真が「ぼやけている」か確認したりして、泥棒を止めようとするようなものです。
  • 論文の発見: これらの古い手口は機能しませんでした。偽の画像やテキストはあまりにも巧みに作られており、安全フィルターはそれらを真実で誠実な情報と区別できませんでした。ロボットの「免疫システム」は完全に回避されてしまいました。

まとめ

この論文は、マルチモーダル RAG システムは驚くほど脆弱であると結論付けています。

  • これらを破壊するために天才ハッカーである必要はありません。いくつかのよく設計された偽の画像とテキストを仕込むだけで十分です。
  • 一度仕込まれたこれらの「毒」は、ロボットを特定の誤った回答に誘導するか、あるいは何らかの正しい回答も出せないように完全に機能を停止させるかのどちらかになります。
  • 現在の安全ツールはこれを防ぐには十分ではありません。

著者たちは、これが明日起こると言っているわけではありませんが、警鐘を鳴らしています:重要な情報を信頼する前に、これらのデジタル図書館のためにはるかに強力な鍵を構築する必要があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →