← 最新の論文
💻 computer science

AgentFlow: A Flow-Centric Policy Language and Framework for Securing LLM Agent Systems

AgentFlowは、ツールや委譲境界を越えた機密データのフローを追跡することでLLMエージェントシステムを保護する、フロー中心のポリシー言語およびランタイム強制フレームワークを導入し、タスクの有用性を維持または向上させつつ、複数のベンチマークにおいて確認された侵害を排除することに成功しました。

原著者: Basavesh Ammanaghatta Shivakumar, Swarn Priya, Peng Gao

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Basavesh Ammanaghatta Shivakumar, Swarn Priya, Peng Gao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代のデジタル環境において、人工知能は単なるチャットボットから、私たちの代わりに複雑なタスクを実行できる有能なアシスタントへと進化しました。これらのシステムは、しばしば「エージェント」と呼ばれ、単に質問に答えるだけでなく、文書を読み、ウェブを検索し、プライベートなデータベースにアクセスし、メールを送信することもできます。彼らは、ユーザーの意図とインターネット上で利用可能な膨大なツール群との間の溝を埋める仲介役として機能します。しかし、この新しいレベルの自律性は、微細ながらも危険な脆弱性をもたらします。その危険は、エージェントが誤ってファイルを削除してしまうような、常に明白で単純なミスではありません。むしろ、それ自体は完全に合理的に見える一連の行動から危害が生じることが多いのです。エージェティストは機密記録を読み、それを要約し、その要約をメールで送信するかもしれません。各ステップは許可されていますが、その組み合わせが情報の漏洩という結果を招きます。これが研究者たちが直面している核心的な課題です。すなわち、個々のステップだけでなく、データの経路も同様に重要となるシステムをいかにして保護するかという問題です。

バージニア工科大学の研究チームは、この特定の問題を解決するために、「AgentFlow」と呼ばれる新しいフレームワークを開発しました。彼らの研究は、単一のアクションが許可されているかどうかをチェックするのではなく、エージェントのワークフローを通じて情報がどのように移動するか、その旅路を追跡することに焦点を当てています。これは、あなたがドアを開けるための鍵を持っているかどうかを確認するだけでなく、あなたがどこへ行き、何を手に取り、そのアイテムを最終目的地に持っていくことが許可されているかどうかを監視する警備員のようなものです。AgentFlowはこの原則に基づいて動作します。それは、あらゆるデータを、その感度、カテゴリ、および信頼性を記述するラベルを持つものとして扱います。データが信頼できないウェブサイトから来た場合、それは「信頼できない(untrusted)」というラベルを帯わせます。もしそれが社会保障番号を含んでいる場合、「機密(confidential)」というラベルを帯わせます。システムはその後、データがデータベースからツールへ、そして最終的にメールや公開投稿へと移動するにつれて、これらのラベルがどのように変化するかを監視します。

研究者たちは、システムオペレーターがデータの旅路に関するルールを記述できる言語を構築しました。これらのルールは、機密性の高い要約が外部のメールアドレスに到達することを禁止したり、信頼できないウェブコンテンツが信頼できる内部指示として扱われることを防いだりすることができます。システムは、人工知能とそれが使用するツールの間にモニターを配置することで機能します。エージェントがツールを呼び出すことが許可される前に、モニターはデータの現在の状態をチェックします。「この情報はどこから来たのか?」「浄化(サニタイズ)されたか?」「エージェントをこの特定の場所に送ることは許可されているか?」と問いかけます。もしこれらの質問のいずれかに対する答えが「ノー」であれば、そのアクションはブロックされます。このアプローチは、ユーザーがそもそもツールを使用する権限を持っているかどうかのみを見る古いセキュリティ手法とは異なります。それらの古い手法は、安全なツールが不安全なデータと共に使用される危険性を見逃していました。

ルールが妥当であることをデプロイ前に確認するために、研究者たちは数学的検証器を作成しました。このツールはストレス・テストとして機能し、ルールが破られる可能性があるシナリオを数千通りシミュレーションします。テストにおいて、この検証器は、ルールを欺こうとするあらゆる不安全なバリエーションを捕捉することに成功しました。彼らが実世界のシミュレーションにシステムを投入した際、結果は驚くべきものでした。エージェントを騙してデータを漏洩させたり、不正なアクションを実行させたりするように設計された約950件のテストケースにおいて、システムは確定したセキュリティ侵害を33パーセントからゼロへと減少させました。別の200件の動的で現実の生活に近いタスクのセットでは、攻撃の成功率を73.5パーセント削減し、失敗率をゼロにまで抑えました。極めて重要なことに、システムはエージェントの業務遂行能力を損なうことなくこれを行いました。実際、多くのケースにおいて、セキュリティルールがデータに隠された悪意のある指示によってエージェントが注意を逸らされるのを防いだため、エージェントは本来の目的のタスクをより多く完了することができました。

研究者たちは、自分たちの研究の限界を慎重に定義しました。彼らは、AIが事実を捏造したり、悪い助言を与えたりするといった、AIに関するあらゆる問題を解決したと主張しているわけではありません。彼らのシステムは、ツールや外部接続を通じたデータの流れを制御するために特別に設計されています。また、セキュリティモニター自体が信頼でき、正しく実装されていることを前提としています。本研究は、攻撃者が、毒されたウェブページや悪意のあるメールなどの信頼できないコンテンツをエージェントに送り込み、ユーザーが意図しないアクションを実行させるようエージェントを操ろうとする、特定の種類の脅威に焦点を当てています。データの経路に着目することで、AgentFlowは、個々のステップがどれほど無害に見えても、これらの攻撃を阻止します。

評価の結果、このシステムは銀行業務、旅行計画、ワークスペース管理など、さまざまな種類のタスクにおいて機能することが示されました。あるシナリオでは、エージェントが顧客のプライベートな記録を要約して攻撃者にメールを送るよう騙されました。標準的なセキュリティシステムであれば、エージェントにメッセージ送信の権限があるため、そのメールを許可したかもしれません。しかし、AgentFlowは、要約されているデータが機密であり、かつメールが適切なセキュリティチェックなしに外部アドレスへ送られようとしていることを見抜きました。そして、そのアクションをブロックしました。別のケースでは、攻撃者が悪意のある指示を正当な内部ポリシーであると信じ込ませようとしました。システムは、その指示が信頼できないソースから来たものであることを認識し、エージェントがそれに基づいて行動することを拒否しました。

研究者たちはまた、このセキュリティレイヤーがエージェントの速度をどの程度低下させるかも測定しました。彼らは、各決定に加えられる時間はマイクロ秒単位であり、AIが思考しレスポンスを生成する時間と比較すれば無視できるほど微小であることを発見しました。これは、保護がスピードや使い勝手の犠牲の上に成り立っていないことを意味します。チームは、ツールの接続を悪用しようとしたり、エージェントのメモリを操作しようとしたりする、既知の幅広い攻撃手法に対してシステムをテストしました。攻撃が設定されたルールに違反するデータの移動に依存しているすべてのケースにおいて、システムはそれを阻止しました。

結果は有望ですが、著者らはこれらを特定の種類のポリシー強制に関する予備的な証拠であると述べています。彼らは、現実世界のアプリケーションには、何が機密であるか、どのようなアクションが許可されるかについて、独自のルールを慎重に定義する必要があることを認めています。システムはユーザーが何を望んでいるかを推測するのではなく、与えられたルールを執行します。もしユーザーが信頼できないウェブコンテンツを公開ブログに送りたいのであれば、それを許可するルールを明示的に設定しなければなりません。その特定の許可がない限り、システムは安全のためにそのアクションをブロックします。この厳格なセキュリティと必要な柔軟性のバランスこそが、強力なエージェントを危険にすることなく有用にするための鍵となります。

この研究は、人工知能のセキュリティに関する考え方の転換を象徴しています。研究者たちは、AIが起こしうるあらゆる方法を予測しようとするのではなく、情報の流れを監視し、明確な境界線を強制するシステムを構築しました。データの出所と、それがどこへ行くことが許可されているかを追跡することで、AgentFlowは現代のエージェントが行う複雑なマルチステップのタスクに対してセーフティネットを提供します。それは、たとえエージェントが危険な経路に誘い込まれたとしても、被害が出る前にその旅路を止めることを保証します。このアプローチは、プライバシーとセキュリティが極めて重要となる環境において、AIエージェントを配備するための実用的な道筋を提供し、自律的な行動に伴う潜在的なリスクを、管理可能で制御されたプロセスへと変えるものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →