← 最新の論文
💻 computer science

Capability-Mediated Perimeters for Secure AI Agent Tool Execution: Conditional Non-Escalation Invariants and Empirical Evaluation Against Indirect Prompt Injection

本論文は、LLMエージェントを信頼できないプリンシパルとして扱い、外部のリファレンスモニターを介して条件付き非エスカレーション不変量を強制することで、間接的プロンプト注入および情報漏洩の脅威に対する実証的な評価において、ゼロの偽陽性と極めて高い攻撃検知率を達成する、決定論優先型のセキュリティアーキテクチャであるMastyf Guardを導入するものである。

原著者: Rudraneel Das

公開日 2026-09-02✓ Author reviewed
📖 1 分で読めます☕ さくっと読める

原著者: Rudraneel Das

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代のコンピューティングの世界において、システムの安全性を維持するために長らく守られてきた基本的なルールがあります。それは、マシンに何をすべきかを指示する「命令」と、マシンが処理する「データ」を分離しなければならないというルールです。この分離により、ユーザーが意図しないコマンドを実行させるよう、コンピュータを誤って、あるいは悪意を持って欺くことを防いでいます。しかし、自律的な人工知能(AI)エージェントの台頭により、この境界線は曖昧になっています。データベースの管理やスマートデバイスの制御といった複雑なタスクを実行するように設計されたこれらのエージェントは、しばしばインターネットから命令と信頼できないデータを同時に、単一のテキストストリームとして読み取ります。コンピュータはデータと命令を一つの混合物として扱うため、巧妙な攻撃者が一見無害なメールやウェブページの中に隠れたコマンドを忍び込ませることができてしまいます。エージェントがその内容を読み取ると、意図しないコマンドに従ってしまい、ファイルの削除やパスワードの窃取といった動作を行ってしまう可能性があるのです。この脆弱性は「間接的プロンプトインジェクション」として知られ、エージェントを、受け取るはずのない命令に従ってしまう「混乱した代理人(confused deputy)」へと変えてしまいます。

Mastyf AI Research Laboratoriesの研究者たちは、これらのエージェントを保護するための新しい方法を提案しました。それは、AI自身に安全性の最終的な判断をさせるという考え方から脱却するものです。AIが起こりうるあらゆるトリックを認識できると期待するのではなく、チームは、アクションが実行される前に厳格な門番として機能するセキュリティシステムを構築しました。彼らはこのシステムを「Mastyf Guard」と呼んでいます。これはシンプルかつ強力な原理に基づいて動作しています。すなわち、AIには思考や推論は許可されますが、自律的に行動する権限は剥奪されるというものです。AIがメールの送信やサーバーへのアクセスといったツールの使用を提案するたびに、独立した別のセキュリティモニターがそのリクエストをチェックします。このモニターはAIの意図を推測しようとするのではなく、代わりにデジタルな許可リストを確認します。これは、クラブのゲストリストをチェックするドアマンのようなものです。もしリクエストされたアクションがその特定のセッションに対して明示的に許可されていない場合、AIの推論がいかに説得力のあるものであっても、そのリクエストは即座にブロックされます。

研究チームは、このアプローチを5万件のシナリオの膨大なコレクションに対してテストしました。その半分はエージェントを欺くために設計された現実的な攻撃であり、残りの半分は開発者による通常の安全な操作です。結果は、彼らのシステムが大多数の攻撃をほぼ瞬時に阻止できることを示しました。最も速いケースでは、セキュリティチェックはわずか0.005秒(5ミリ秒)で行われ、人間にはほとんど感知できないほどの速度でした。システムは攻撃の99.33パーセントを特定してブロックすることに成功し、これは、巧妙なトリックの半分以上を見逃してしまう既存の安全ツールと比較して大幅な改善です。極めて重要なことに、このシステムは高価で高性能なコンピュータチップを必要とせず、標準的なコンピュータプロセッサ上で、わずか1.1GBのメモリ使用量で効率的に動作しました。これは、特別なハードウェアを必要とせずに、日常的なオフィス環境に展開できることを意味します。

この仕組みを理解するために、AIエージェントを、非常に有能だが注意力が散漫な従業員であり、建物全体のマスターキーを渡されていると想像してみてください。もし見知らぬ人が従業員の耳元で偽の指示を囁いた場合、従業員はそのマスターキーを使って、開けてはいけないドアを開けてしまうかもしれません。Mastyf Guardシステムは、従業員のポケットからマスターキーを完全に取り除きます。その代わりに、従業員がドアを開けたいときは毎回、セキュリティガードに許可を求めなければなりません。ガードは従業員の言い分を聞いたり、その口調を解釈したりすることはありません。ガードは単に、その瞬間に従業員がドアを開けることが許可されているかどうかの厳格なリストを確認するだけです。もしリクエストがリストに載っていなければ、ドアはロックされたままになります。このアプローチは、たとえAIが間違ったことを要求するように騙されたとしても、システムにはその権限がないため、単純に実行不可能であることを保証することで、「混乱した代理人」の問題を解決します。

研究者たちはさらに、より微妙な問題にも対処しました。それは、AIがツールの使用は許可されているものの、被害を及ぼすためにリクエストの詳細を変更しようとする場合です。例えば、AIはメールの送信は許可されていますが、攻撃者がそのメールを別のアドレスに送ったり、件名を書き換えたりするようにAIを騙す可能性があります。これに対処するため、チームは「注意深い校正者」のように機能する第二の防御層を追加しました。この層は、リクエストの具体的な詳細を元の許可事項と照らし合わせてチェックします。もしAIが新しい口座に送金しようとしたり、触れてはいけないファイルにアクセスしようとしたりした場合、システムはその変更を検知します。3,000件の複雑なビジネスシナリオを含むテストにおいて、この厳格な許可チェックと詳細な校正の組み合わせは、97.5パーセントの攻撃を検知・阻止し、2,000件の良質なエンタープライズ操作における誤検知率は0.19%という統計的上界を維持しながら、誤検知率ゼロを実現しました。システムは非常に精密であり、2,000件の通常のビジネス操作において、一度も誤報を出すことはありませんでした。

この研究の重要な発見の一つは、効果を発揮するために超知能AIである必要はないということです。研究者たちは、小さな特化したコンピュータプログラムが、マイクロ秒単位で大部分のセキュリティチェックを処理でき、リクエストが曖昧または疑わしい場合にのみ、より大規模で複雑なAIモデルを呼び出せばよいことを見出しました。このハイブリッドなアプローチにより、システムは高速かつ安価に動作します。日常的な業務トラフィックにおいて、複雑なAIモデルが必要とされることはなく、システムは高速でシンプルなチェックの速度で動作しました。システムがトリッキーなリクエストを調査するために大きなモデルを呼び出す必要があった場合でも、約18ミリ秒を要しましたが、これはほとんどのリアルタイムアプリケーションにとって十分に高速な速度です。この設計により、セキュリティが速度や使い勝手を犠牲にすることなく、ビジネスが日常業務を遅らせることなく強力なAIエージェントを使用できることが保証されます。

また、研究では、許可されたツールの連鎖を通じてシステムからデータが漏洩することを防ぐ方法についても調査しました。攻撃者が禁止されたツールを使用するようにAIを強制できなくても、情報を一つの許可されたツールから別のツールへと移動させることで、実質的にデータを外部へ持ち出す(エクスフィルトレーション)ことが可能です。標準的な権限チェックのみでは、攻撃者が許可されたツール間で情報を移動させることで、かなりの割合でデータの持ち出しに成功することを見出しました。これを阻止するために、研究者たちは、現金の動きを追跡して消失を防ぐ銀行の仕組みと同様に、情報の流れを追跡するトラッキングシステムを実装しました。このシステムは、パスワードや財務記録などの機密データにマークを付け、そのデータが受け取りとして明示的に承認された目的地にのみ移動できるようにします。1,000件以上のデータ窃盗試行を含むテストにおいて、システムはこの特定のトラッキング手法を用いたすべての試行をブロックし、機密情報が許可されていない場所に移動できないようにしました。

このシステムは目覚ましい成功を示しましたが、研究者たちはその限界についても慎重に言及しています。セキュリティの保証は、セキュリティモニター自体が信頼できるコンピュータ上で動作しており、ハッキングされていないという仮定に基づいています。もしモニターが侵害された場合、システム全体が失敗します。さらに、本システムはツールを不正な方法で使用しようとする攻撃を阻止することには優れていますが、あらゆるバリエーションのトリック、特にシステムを混乱させるために設計された複雑な多段階の手口をすべて捉えることができるほど完璧ではありません。研究者たちは、システムが回避された少数のケースを特定しており、それらは主に非常に特殊な金融的なトリックやドメイン名の偽装に関連するものでした。彼らはすでにこれらのギャップを修正するためのアップデートを提案しています。彼らは自身の研究を「プレプロダクション・アーキテクチャ」と表現しており、これは、実世界の環境でのテスト準備は整っているものの、最終的な商用製品と見なされる前には、独立した専門家によるさらなる検証が必要であることを意味しています。

この研究の意義は、単にAIをより安全にすることにとどまりません。それは、知的なシステムをどのように構築するかという私たちの考え方を変えるものです。AIを、自らを監視できる信頼できるパートナーとしてではなく、常に監視されなければならない「潜在的に信頼できないコンポーネント」として扱うことで、研究者たちはより壊れにくいフレームワークを作り上げました。この視点の転換により、ミスが発生した場合のコストが高い病院、銀行、政府機関のような機密性の高い環境においても、強力な自律型エージェントを使用することが可能になります。このシステムは、高度なセキュリティが速度を犠牲にしたり、高価なハードウェアを必要としたりすることなく実現できることを証明しており、将来の人工知能のための実用的なソリューションとなっています。これらのエージェントが私たちの日常生活において一般的になるにつれ、思考と行動を分離し、どのようなアクションが許可されるかについて厳格なルールを適用する能力は、デジタル世界を安全に保つために不可欠となるでしょう。

研究者たちは、自分たちのツールとデータを公開し、他の科学者が研究をテストし、改善できるようにしました。彼らはセキュリティモニターのコードと学習済みAIモデルを公開し、グローバルなコミュニティが弱点を見つけ、改善案を提示することを呼びかけています。このオープンさは科学的プロセスの重要な部分であり、システムが単なる理論的なアイデアではなく、精査され洗練されることができる実用的なツールであることを保証するものです。研究は、厳格で決定論的なルールと、スマートで柔軟なチェックを組み合わせることで、自律型エージェントのための安全な環境を構築できることを結論づけています。今後の道のりは、これらのシステムを現実世界のシナリオでテストし続け、新しい種類のトリックを捉えるためにルールを洗練させ、脅威が進化してもテクノロジーが堅牢であり続けることを確認していくことにあります。この研究は、自律型AIの約束を、すべての人にとって安全で信頼できる現実にするための重要な一歩を象徴しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →