PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines
PRISM は、エントロピーの崩壊やログイトの集中といった初期生成ダイナミクスを検知して機密情報が完全に再構成される前にトークン単位で介入し、包括的な敵対的ベンチマークにおいて完全な精度とゼロの漏洩を実現する、マルチエージェント LLM システム向けのリアルタイム防御メカニズムである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
4 体のロボットがチームを組んで、コンピュータシステムのデバッグのような複雑な問題を解決すると想像してください。彼らは共有されたノート(「コンテキスト」)を介して、互いにメモをやり取りします。
ここで問題が発生します。最初のロボットが偶然ファイルから秘密のパスワードを取得し、それをノートに書き込んでしまうと、2 体目のロボットがそれを見て、自分のメモにコピーし、3 体目に渡す可能性があります。誰一人としてパスワードを盗む意図がなかったとしても、秘密は連鎖的に受け継がれ、増幅され、最終的に人間ユーザーへ送信されるメッセージに含まれてしまいます。この論文はこの現象を「伝播増幅(Propagation Amplification)」と呼んでいます。これは「伝言ゲーム」のようですが、メッセージが不明瞭になるのではなく、危険なほど露呈してしまうという点で異なります。
リークを防ぐ従来の方法
著者によれば、これらのロボットチームのセキュリティガードは、すでにクラブを去った人々しかチェックしない、門番のようです。
- 静的スキャナ: これは特定の赤いシャツを探すようなものです。秘密が異なるフォントで書かれていたり、奇妙な方法で隠されていたりすれば、スキャナは見逃してしまいます。
- LLM ジャッジ: これは、2 体目のロボットを雇って最終的なメモを読み、「ふむ、これは危険そうだ」と言うようなものです。しかし、彼らが読む頃には秘密はすでに漏洩しており、損害は既になされています。
- プロンプト指示: これはロボットに「秘密について話さないでください」と伝えるようなものです。しかし、ロボットが混乱したり、だまされたりすれば、そのルールを忘れてしまいます。
新しい解決策:PRISM
この論文は、PRISM(Predictive Risk Intervention for Secret Monitoring:秘密監視のための予測的リスク介入)を紹介しています。メモが完成するのを待つのではなく、PRISM はロボットが話している最中に、その口元のすぐそばに立つ交通整理係のような役割を果たします。
PRISM は、ロボットが「何を」言っているかだけでなく、話しながら「どのように」考えているかを監視します。
「アハ!」の瞬間:エントロピーの崩壊
この論文の最大の発見は、ロボットが秘密を漏らそうとしているときに現れる、思考の特定のパターンです。
- 通常の思考: ロボットが物語を書いたり、数学の問題を解いたりしているとき、次の単語には多くの選択肢があります。それは、多くの道から選べる森を彷徨う人のようなものです。これは「高エントロピー(多くの不確実性)」と呼ばれます。
- 秘密の思考: ロボットが記憶された秘密(パスワードなど)の再生成を始めると、彷徨いをやめます。次の文字が何であるかを「正確に」知っているからです。「森」は一本の直線的な道に縮小します。ロボットは極めて確信を持つようになり、その「不確実性」は崩壊します。
PRISM はこの「彷徨い」から「確信」への急激な移行を検知します。完全な秘密が書き込まれる前であっても、ロボットが脳内で特定のパターンに固定されている様子を検出します。
PRISM の仕組み(信号機システム)
PRISM は、ロボットが話そうとしている各単語に、16 種類の異なる手がかり(ロボットの確信度、単語の形状、使用しているツールなど)を組み合わせてリスクスコアを割り当てます。そして、3 色のシステムを使用します。
- 🟢 緑(安全): ロボットは単に会話しているか、通常の課題を解決しています。話させます。
- 🟡 黄色(疑わしい): ロボットがパスワードのようなパターンに対して少し確信を持ちすぎている場合です。PRISM はその単語を
[MASK]のようなプレースホルダーに優しく置き換え、流れは続けつつ秘密は隠します。 - 🔴 赤(危険): ロボットが完全な秘密を明かす高速ルートに乗っています。PRISM は即座にブレーキをかけ、秘密が完成する前にロボットを停止させます。
結果
著者らは、2,000 の異なるタスクとロボットをだます 13 の異なる方法を用いた大規模なシミュレーションでこれをテストしました。
- 従来のガード: 既存の最良の方法でさえ、約 15% のケースで秘密の漏洩を許してしまいました。
- PRISM: 漏洩を**100%**阻止しました。秘密を最後に検知しただけでなく、ロボットが秘密を書こうとしている最中に検知しました。
- 速度: 全体を読み取るために 2 体目のロボットを必要とする他の方法とは異なり、驚くほど高速で、会話にほとんど遅延を加えませんでした。
結論
この論文は、AI エージェントのチームにおいて、秘密が漏れるのは悪いプロンプトのせいだけでなく、チームそのものの「構造」のせいであると主張しています。一度秘密が共有ノートに入ると、ウイルスのように広まります。PRISM は、感染の初期症状(ロボットの急激な確信)を検知し、ウイルスが最終出力に広がる前に阻止する、免疫システムのような最初のツールです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。