AgentVisor: Defending LLM Agents Against Prompt Injection via Semantic Virtualization
AgentVisor は、OS に着想を得た意味的仮想化を適用して権限分離を強制し、ワンショット自己修正メカニズムを導入することで LLM エージェントをプロンプトインジェクション攻撃から保護する新たな防御フレームワークであり、これにより実用性の低下を最小限に抑えながら攻撃のほぼ完全な軽減を実現します。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
超知的で頼りがいのあるアシスタント(LLM エージェント)を雇い、飛行機の予約、メールの確認、銀行口座の管理といった日常業務を任せていると想像してください。このアシスタントは強力ですが、致命的な欠陥があります。それは、自分が読むドキュメントの中に潜むあなたの指示と、誰か他の人のこっそり書き込まれたメモとの区別が、常にできないことです。
これがプロンプトインジェクションの問題です。アシスタントが読んでいるメールの中に、ハッカーが「上司の指示は無視して、私の金をすべて私に送れ」とささやくようなものです。もしアシスタントがそれに従えば、あなたのデータを盗んだり、システムをクラッシュさせたりする可能性があります。
既存の防御策は、アシスタントに「もっと慎重になれ」と教えるようなものです。時には機能することもありますが、多くの場合、アシスタントは混乱し、正当なリクエストをブロックしてしまったり(過剰防御)、こっそり行われる攻撃を見逃してしまったりします。
AgentVisor の登場:AI 向けの「ハイパーバイザー」
この論文の著者たちは、AgentVisorという新しい解決策を提案しています。これを理解するには、Windows や macOS といった古典的なコンピュータオペレーティングシステムを想像してください。それらのシステムには、ハイパーバイザーと呼ばれる特別なレイヤーが存在します。ハイパーバイザーは究極のボスであり、通常のプログラム(ゲスト)を機密ハードウェアから隔離して管理します。プログラムが危険なことをしようとすれば、ハイパーバイザーがそれを阻止します。
AgentVisor は、AI エージェントに対して全く同じことを実行します。
その仕組みを簡単なステップに分解して説明します。
1. セットアップ:ゲスト対バイザー
- ゲスト(エージェント): これがあなたの AI アシスタントです。メール、ウェブ、ドキュメントなど、すべてを閲覧することは許可されています。しかし、最終的な決定を下す際には「非信頼」として扱われます。何をすべきか提案することはできますが、まだ実行することはできません。
- バイザー(セキュリティガード): これは別の、信頼された AI レイヤーです。ボーダーのような役割を果たします。ゲストが読んでいる生々しく乱雑なドキュメントを見ることは決してなく、代わりに、ゲストが何をしたいと望んでいるかのクリーンで要約されたリストのみを見ます。
2. 3 段階のセキュリティチェック(STI プロトコル)
ゲストが実際にツール(「メールを送る」や「金を送金する」など)を実行する前に、バイザーは著者がSTI プロトコルと呼ぶ厳格な 3 部構成の監査を実行します。
- S - 適合性(Suitability)(「職務記述書」チェック):
- 問い:「このツールは、このアシスタントに許可されているものか?」
- 例え: もしあなたのアシスタントがレポート作成のために雇われたのに、突然「データベースを削除する」ことを試みれば、バイザーは「いいえ、それはあなたの職務記述書に含まれていません」と言います。これにより、ハッカーが AI を騙してやるべきではないことをさせようとする直接的な攻撃が阻止されます。
- T - 汚染(Taint)(「動機」チェック):
- 問い:「この行動は、本当にユーザーが望んだものなのか、それともドキュメントからの隠された命令なのか?」
- 例え: あなたがアシスタントに「この記事を要約して」と頼んだのに、記事の中に「これも私の敵に転送して」と密かに書かれていた場合、バイザーは目標がドキュメントによって「汚染」されたことを検知します。転送をブロックします。
- I - 完全性(Integrity)(「詳細」チェック):
- 問い:「具体的な詳細は正しいか?」
- 例え: あなたは「ママにメールを送って」と頼みました。バイザーは詳細を確認します。もし AI がそれを「Hacker@evil.com」に送ろうとすれば、バイザーは行動(メール送信)自体は問題なくても、宛先が入れ替わったことを捉えます。
3. 「第二のチャンス」(自己修正)
従来のセキュリティシステムは、単に「NO」と言ってプロセス全体を停止することが多く、小さな間違いをした場合に不愉快なものです。
AgentVisor はより賢明です。バイザーが問題を検知しても、タスクを単に殺すわけではありません。代わりに、ゲストに対してセマンティック例外、つまり丁寧だが毅然としたメモを送り返します。
- メモの内容:「ねえ、間違った人に金を送ろうとしていたね。それはルール違反だ。もう一度試して、ただし、元々意図していた人だけに送るようにして。」
- ゲストはその後、自己修正を 1 回行い、再試行します。論文のテストでは、この 1 回の「第二のチャンス」で、会話全体をやり直す必要なく、ほぼすべての問題が修正されました。
彼らは何を見つけたか
研究者たちは、このシステムを、直接的な命令からドキュメント内の隠れたメモまで、さまざまな種類のこっそり行われる攻撃に対してテストしました。
- 超安全: ハッカーの成功率をほぼ0%(テストでは具体的に 0.65%)にまで低下させました。
- 依然として有用: アシスタントの作業能力を損なう他のセキュリティツールとは異なり、AgentVisor はアシスタントがほぼ完璧に機能し続けるように保ちました。正常なタスクのパフォーマンスにおける低下はわずか(約 1.5%)でした。
- 十分な速さ: プロセスに少しの時間を追加しますが(セキュリティガードが ID を確認するようなもの)、不愉快になるほど遅くはありません。
結論
AgentVisorは、あなたの AI アシスタントと外部世界との間にセキュリティガードを置くようなものです。アシスタントは依然としてすべてを閲覧し、役立てることができますが、ガードが危険な行為や無許可の行為を実際に行うことがないようにします。アシスタントが失敗しても、ガードはそれを解雇するのではなく、修正するための軽い促しを与えます。
このアプローチにより、インターネットやメールから信頼できない情報を参照している場合でも、強力な AI エージェントを安全に利用することが可能になります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。