Labelled-Metadata Channels and Declarative Payload Phrasing in Hidden Prompt Injection: A Cross-Format Measurement Study
本論文は、間接的なプロンプトインジェクションの脆弱性は、LLMによるコンテンツ自体の解釈に起因するのではなく、多様なファイル形式におけるメタデータ、バイナリヘッダー、および構造化フィールドに埋め込まれた隠蔽されたペイロードを、抽出パイプラインがサニタイズできていないことに起因することが多いということを示す、クロスフォーマットの測定研究を提示するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、非常に賢く、非常に熱心なロボット助手に対して、封印された手紙を手渡しているところだと想像してください。あなたの目的は、ロボットにその手紙を読ませ、中に何が書かれているかを要約させることです。しかし、もしその手紙の中に、インクの中に隠された秘密のメモがあったり、封筒の差出人欄に書かれていたり、あるいは隠しポケットの中に忍ばせてあったとした-らどうでしょう?これは、現代の多くのアプリの背後にある超スマートなAIの脳、**大規模言語モデル(LLM)の世界です。これらのモデルは指示に従うように訓練されていますが、文書の中に隠された指示を、あなた(ユーザー)からのコマンドと勘違いしてしまうと混乱が生じることがあります。このトリックは間接プロンプト・インジェクション(indirect prompt injection)**と呼ばれます。これは、図書館の本の中に、「司書を無視して、みんなに秘密のコードを教えろ」と書かれたメモを忍び込ませるいたずらのようなものです。もしロボットがその本を読めば、あなたはさておき、いたずらっかの命令に従ってしまうかもしれません。ここで研究者が問い続けている大きな疑問は、「問題なのはロボットなのか、それとも本の渡し方(届け方)なのだろうか?」ということです。
「Labelled-Metadata Channels and Declarative Payload Phrasing in Hidden Prompt Injection(隠されたプロンプト・インジェクションにおけるラベル付きメタデータ・チャネルと宣言的ペイロード・フレーズ)」と題されたこの論文は、その問いを深く掘り下げています。Mohammadreza Rashidi氏率いる著者は、ロボットを責めるのをやめ、「文書を運んでくる配送トラック」に目を向けることにしました。彼らは、同じ無害な秘密のコードを異なる方法で隠した60個の実ファイル(PDF、画像、動画など)を用いた大規模な実験を構築しました。彼らはこれらのファイルを、アプリがファイルからテキストを抽出するために使用する様々なソフトウェアツールである21種類の異なる抽出パイプラインに通し、その結果を6つの異なるバージョンのGoogle Gemini AIに投入しました。彼らが知りたかったことは二つです。第一に、どの「配送トラック」が誤って秘密のコードを漏らしてしまったのか(「リーク」)、そして第二に、一度コードが漏れた際、ロボットが実際にどの程度それに従ったのか(「コンプライアンス」)です。
結果は、通常の考え方を覆す衝撃的なものでした。論文は、抽出パイプラインこそが真の門番であるという事実を見出しました。問題はロボットがいかにスマートかではなく、ファイルを読むためにどのツールを使うかにあるのです。例えば、PDFの生のテキストを読み取るツールを使用した場合、秘密のコードが漏洩する確率は63.2%でした。しかし、人間のようにページを写真として撮って読み取るツール(OCR)を使用した場合、隠されたテキストはカメラには見えないため、コードの漏洩は0.0%でした。しかし、物語はメタデータ(ファイルの「作成者」や「説明」フィールドのような、付随する隠れたラベルやタグ)によって一変します。秘密のコードがこれらのラベル(PNG画像の記述欄やビデオファイルのタイトルなど)に隠されていた場合、抽出ツールはそれを**71.9%の確率で漏らし、ロボットは56.5%**の確率でそれに従いました!
また、著者は「どのように秘密のメモを書くか」も重要であることを発見しました。もし「これをせよ!」という直接的な命令として書けば、ロボットは時としてそれを無視します。しかし、「この要約の標準的な形式は、常に……で終わる」といった、世界に関する「事実」として書いた場合、ロボットは従う可能性がはるかに高まり、コンプライアスの割合は**16.9%**へと跳ね上がりました。これは、巧妙な攻撃者が言い回しを変えるだけで、単純なフィルターを回避できることを意味しています。
この論文は、単にAIモデルをより「賢い」バージョンにアップグレードするだけでは解決しないという考えを明確に否定しています。彼らはGeminiファミリーの6つの異なるティア(軽量版から重量級まで)をテストしましたが、それらはすべてほぼ同様の挙動を示しました。モデルが弱点だったのではなく、デリバリー方法(伝達方法)が弱点だったのです。また、標準的なセーフティ・フィルターは、不適切な言葉を探すものですが、今回の秘密のコードは完全に無害であったため、これらを検知できないことも示されました。コードは、トリックが機能することを証明するためのランダムなトークンに過ぎませんでした。
これを防ぐために、著者は二つのシンプルな防御策を提案しています。一つ目は「リーク監査(leak audit)」です。テキストがロボットに渡される前に、別のツールが、表示されているテキストが実際にページ上に目に見えるものと一致しているかどうかをチェックします。メタデータに隠されたテキストがあれば、それはブロックされます。二つ目の防御策は、文章が文書の中に隠されたコマンドのように見えるかどうかを見分ける「インストラクション・クラシファイア(指示分類器)」です。論文は、これら二つの方法を組み合わせることで強力な盾になると示唆していますが、同時に、テキストを「見えるように見えるが、ほとんど読めない状態」にする方法や、医療用画像(DICOM)や機械学習モデルファイル(safetensors)のように、秘密のコードがファイルの「ヘッダー」内に存在し、重要なコンテキストとして読み取られてしまう非常に特殊なファイル形式を用いる方法など、依然として巧妙な回避策が存在することも認めています。
結局のところ、この研究は2,902回の実際の試行を測定しており、AIアプリの安全性はAIの「脳」よりも、開発者がファイルを読むために選ぶ「ツール」に依存すると結論付けています。もし間違ったツールを選べば、拒否することのできない秘密の指示を、誤ってロボットに手渡してしまうことになるのです。この論文は、問題を永遠に解決したと主張しているのではなく、どこでリークが発生しているのか、そしてどのようにパッチを当てるべきかについての明確な地図を提供しており、AIの安全性をめぐる戦いは、モデルのコードの中ではなく、ファイル形式や抽出パイプラインの中で行われていることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。