← 最新の論文
💻 computer science

Agent Guard: Kernel-Enforced Damage Boundaries for AI Agents via Human-Authorized Contracts

本論文では、eBPFベースのLSMを用いることで、AIエージェントに対して許可されていないファイルおよびネットワークアクセスを決定論的に拒否し、プロセス階層全体に厳格な「ノー・エグレス(外部送信禁止)」状態を伝播させることにより、既存のベースラインよりも大幅に低いオーバーヘッドを実現して、人間が承認した損傷境界を強制するLinuxリファレンスモニターであるAgent Guardを提案する。

原著者: Dongxu Cui, Zhichao Gu, Ping Zheng, Wenshuai Xi, Simeng Han, Yong Liao

公開日 2026-09-01
📖 1 分で読めます☕ さくっと読める

原著者: Dongxu Cui, Zhichao Gu, Ping Zheng, Wenshuai Xi, Simeng Han, Yong Liao

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代のデジタル環境において、人工知能は単なるテキスト生成器から、複雑なタスクを計画し、プログラムを実行し、コンピュータ上のファイルやネットワークと相互作用できる能動的なワーカーへと進化しました。しかし、この新たな自律性は、特有のリスクをもたらします。もしAIがミスをしたり、悪意のあるプロンプトに騙されたり、あるいは単に危険な指示を幻覚(ハルシネーション)として生成したりした場合、本来助けるべきシステムそのものにダメージを与えるコマンドを実行してしまう可能性があるのです。従来のセキュリティ対策は、ツールの名前を確認してから中に入れるクラブのドアマンのような役割を果たしますが、そのツールがシェルを開いたり、子プロセスを生成したり、あるいは後に別のプログラムによって読み取られるファイルを書き込んだりした後に何が起こるかを追跡することには苦慮しています。一度AIが初期チェックを通り抜けてしまうと、その行動はオペレーティングシステム全体に波及し、どの実行部分が許可されたもので、どの部分が害を及ぼしたものなのかを、セキュリティチームが判別できなくなることがあります。

これを解決するために、研究者たちは「Agent Guard」と呼ばれるシステムを開発しました。これは、コンピュータの核であるカーネル内部で、絶えず監視を続ける「まばたきをしないモニター」として機能します。AIがルールに従うことを信頼したり、AIに何を許可すべきかを提案させたりするのではなく、このシステムは、AIが実行を許可される前に人間が境界線を確定することを要求します。人間がAIの行動に対する特定のルールを承認し、その後、コンピュータのオペレーティングシステムが絶対的な確実性をもってこれらのルールを強制します。もしAIが承認された範囲外の行動を取ろうとした場合、システムは被害が発生するずっと前に、即座にそれを阻止します。このアプローチは、AIが犯す可能性のあるあらゆるミスを予測しようとするのではなく、人間が安全に触れてもよいと判断した資産の周囲に、硬固で壊れることのないフェンスを作ることに焦点を当てています。

研究者たちは、人間の承認とAIの実行の間に位置する特別なゲートを作成することで、このシステムを構築しました。AIがコードを実行する前に、人間は提案された計画をレビューし、AIがアクセスを許可されるファイルとネットワーク接続を正確に確認しなければなりません。この確認は単なる提案ではなく、コンピュータのオペレーティングシステムが確定させる正式な契約です。システムは、この契約をAIが行おうとしている特定のタスクに紐付けます。もしAIがこの契約に違反するコマンドを実行しようとした場合、オペレーティングシステムは即座にその要求を拒否します。決定的なのは、システムが初期のコマンドだけをチェックするのではなく、一連のイベント全体を監視している点です。AIがファイルを書き込み、そのファイルを後に別のプログラムが読み取った場合、制限はそのファイルと共に移動します。AIがネットワーク接続を開いた場合、たとえ制限が完全に適用される前に接続が確立されていたとしても、契約で禁止されていれば、データがコンピュータから外部へ流出しないようシステムが保証します。

このレベルの制御を実現するために、研究者たちは、システムの内部フックに直接アタッチできる技術を使用しました。彼らは、すべてのプロセス、ファイル、および通信チャネルに特定のステータスを付与するデータプレーンを作成しました。プロセスが制限されたファイルを読み取ると、そのプロセスは制限を継承します。プロセスがパイプやソケットに書き込むと、その制限は反対側へと伝播します。この伝播は単調(モノトニック)であり、一度適用された制限は、プログラムを再起動したりファイル名を変更したりすることによってAIが取り消すことはできません。システムは、「禁止」ステータスがプロセスのネットワークを通じて、決して洗い落とすことのできない染みのように広がることを保証し、AIが中間ステップを通じてルールを回避するために自身の行動を「洗浄」することを防ぎます。

チームは、このシステムが設計された通りのダメージを実際に阻止できるかどうかを確認するために、厳格なテストを行いました。彼らは、AIがアクセスすべきでないファイルにアクセスしようとしたり、制限後にデータをネットワーク経由で送信しようとしたり、あるいは他のプログラムに制限を渡そうとしたりするケースを含む、19種類のシナリオにわたる数百の形式的なセキュリティテストを実施しました。570件のテスト記録すべてにおいて、システムは意図通りに動作しました。システムは、許可されていないアクションを拒否し、異なる種類のファイルや通信チャネル間で制限を正しく伝播させ、合意された境界の外側で副作用が発生しないことを確実にしました。このシステムは、AI自身の判断やポリシーの提案に頼ることなく、人間が承認した厳格なダメージ境界を維持できることを証明しました。

単に動作を証明するだけでなく、研究者たちはこの追加のレイヤーがコンピュータの動作をどれほど遅延させるかを測定しました。彼らは、自分たちのシステムを、以前の手法である「ActPlane」と比較しました。ファイルへの読み書きを含むテストにおいて、新しいシステムは、セキュリティ対策が全くないコンピュータと比較して、約12パーセントの遅延しか追加しませんでした。対照的に、古いシステムは、タスクに応じて33パーセントから61パーセントの速度低下を引き起こしました。この顕著な差は、新しいアプローチがより安全であるだけでなく、より効率的でもあり、スピードが重要となる実世界の利用において実用的であることを示唆しています。研究者たちは、ルールのチェックとデータの流れを追跡するためのコストは、前世代のツールが持つ重いオーバーヘッドと比較すると、極めて最小限であることを見出しました。

また、この研究は、システムが「何をしないか」についても強調しており、それは「何をすること」と同じくらい重要です。このシステムは、AIの安全性に関するあらゆる問題を解決すると主張しているわけでも、人間の最初の決定が完璧であったことを保証するものでもありません。それは単に、人間が決めたことがルールであるならば、コンピュータがそのルールを違わず遵守することを保証するものです。宣言されなかった資産に対しては保護を提供せず、また、人間が明示的に危険なアクションを承認した場合に、AIが害を引き起こすことを止めるものでもありません。このシステムは、執行のためのツールであり、人間の判断の代わりとなるものではありません。それは、「安全なAI」という複雑でしばしば曖昧な概念を、人間によって定義された境界が機械によって強制されるという、具体的な技術的現実へと変えるものです。

結局のところ、この成果は、厳格かつ効率的なAIのセーフティネットを作ることが可能であることを示しています。アクションを提案する役割としてのAIと、それを承認する役割としての人間を分離し、それらの承認を強制するためにオペレーティングシステムを使用することで、研究者たちはダメージが限定され、予測可能となるモデルを作り上げました。システムはAIが「行儀よく振る舞うこと」を信頼しているのではなく、AIが「不適切に振る舞うこと」をオペレーティングシステムが防ぐことに依拠しています。エージェントを信頼することから、契約を強制することへのこの転換は、自律型コンピューティングの未来をどのように守るかについての根本的な変化を表しており、たとえAIがミスを犯したとしても、その結果が人間が築いた壁の中に封じ込められることを保証しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →