← 最新の論文
🤖 AI

Bounded Agents: Delegation Security for Multi-Agent AI Systems

本論文は、プロンプトインジェクション攻撃、不正な委任、および禁止されたアクションの組み合わせを防止するために、動的かつ状態を認識した認可チェックを強制することにより、低レイテンシを維持しつつ、データ漏洩および操作のリスクを限りなくゼロにまで低減する、LLMベースのマルチエージェントシステムにおけるリスクを軽減するセキュリティアーキテクチャであるAgentic Principal Chain(APC)を導入するものである。

原著者: Xabier Muruaga

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Xabier Muruaga

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代のデジタルな職場において、新しい種類の労働者が登場した。それは「ソフトウェア・エージェント」である。これらは大規模言語モデルによって駆動されるプログラムであり、文書を読み、メールを送信し、システム間でデータを移動させ、さらには他のプログラムを呼び出して仕事を遂行することができる。彼らは人間の従業員に代わって行動し、指示を受け取り、それを一連のアクションへと変換する。その約束されている恩恵は計り知れないほど大きいが、リスクも同様に高い。もし人間の従業員が騙されて機密ファイルを誤った人物に送ってしまった場合、被害はその個人の判断ミスにとどまる。しかし、ソフトウェア・エージェントが騙された場合、その間違いは完璧な速度で実行され、それがアクセスを許されているあらゆるシステムに対して展開される可能性がある。セキュリティ専門家にとっての核心的な課題は、単にこれらのエージェントが騙されないよう賢くすることではなく、たとえエージェントが騙されたとしても、(物理的に)損害を与えることが不可能なシステムを構築することにある。

これは、独立系研究者のザビエル・ムルアガ(Xabier Muruaga)による新しい研究が取り組んでいる中心的な問題である。彼は、エージェントの「脳」をより強固にするのではなく、「何を行うことを許可するか」というルールを厳格化することで、これらのデジタル労働者を保護する方法を提案している。この研究では、ソフトウェア・エージェントが操作を受ける危険性は、主に人工知能モデル自体の問題ではなく、権限アーキテクチャの問題であると論じている。たとえエージェントが無謬であっても、無害なアクションを組み合わせて有害な結果を生み出す自由を与えられていれば、依然として危害を加える可能性がある。例えば、あるエージェントに対し、「機密文書を読み取る権限」と「メールを送信する権限」の両方が与えられているとする。個々の動作としてはどちらも安全である。しかし、もしエージェントが騙されて、文書を読み取った直後に外部アドレスへメールを送るように仕向けられた場合、その組み合わせによってデータ漏洩が発生する。これは、いずれの権限単体でも意図していなかった事態である。

これを解決するために、ムルアガは「エージェンティック・プリンシパル・チェーン(Agentic Principal Chain)」と呼ばれるシステムを開発した。指揮命令系統を想像してみてほしい。人間の上司がマネージャーにタスクを委任し、マネージャーがさらにそのタスクの一部をジュニア・アシスタントに渡すという流れだ。従来のセキュリティシステムでは、一度上司が許可を与えると、その許可は変化することなく連鎖の下へと伝わる。そのため、ジュニア・アシスタントが上司と同じ広範な権限を持つことになり、アシスタントが侵害された場合の大きなリスクとなる。「エージェンティック・プリンシパル・チェーン」は、ステップを下るごとに権限がより小さく、かつ具体的になることで、この問題を解消する。これは、エージェントの思考プロセスの外側に位置する厳しい門番のように機能する。エージェントがあるアクションを実行しようとする前に、この門番は、エージェントがその特定の行為を行う権利を持っているかだけでなく、同じセッション内でエージェントが過去に行ったことは何かを確認する。

このシステムは、「セッション状態(session state)」、すなわちエージェントが行ったすべてのアクションの進行中のログを追跡することで機能する。もしエージェントにファイルの読み取り権限があり、かつメールの送信権限もある場合、システムは履歴を参照する。もしエージェントがたった今秘密のファイルを読み取っていたとしたら、次にメールを送信しようとする試みを、たとえメール送信自体が一般的に許可されていたとしてもブロックする。これにより、エージェントが二つの安全なアクションを結合して危険なものを作り出すのを防ぐ。研究者たちはこれを「組成閉包(composition closure)」と呼ぶ。これは、個々の手順が許可されているかどうかに関わらず、特定のアクションの組み合わせは禁止されるというルールである。また、このシステムは単独のエージェントの影響範囲(ブラスト・ラジアス)をも制限する。サブエージェントが侵害されたとしても、それが引き起こせるダメージは、自身を作成したエージェントから受け継いだ権限よりも厳密に小さいものであるため、数学的に限定される。これにより、システムの一部のブリーチ(突破)が制御不能となり、組織全体を破壊してしまうような連鎖を防ぐことができる。

このアプローチが実際に機能するかどうかを検証するため、研究者たちはシステムの稼働版を構築し、確立されたセキュリティ・ベンチマークを用いた一連の厳格な試験を行った。データの窃盗を目的に設計された1,000以上のシナリオを含むテストセットにおいて、システムはすべての試みを阻止した。別のテストセットでは、人工知能モデル自体が完全に妥協し、攻撃者の完全な制御下にある状況をシミュレートしたが、それでもシステムは攻撃を食い止めた。モデルが盗んだデータを送信しようとした際、ゲートキーパーは、そのアクションの組み合わせがセッション・ルールに違反していたため、要求を拒否したのである。また、本システムは、エージェントが元のタスクとは異なる方法でファイルを破壊したりデータを操作したりすることを防ぐことにも成功し、そのような攻撃の成功率を90%以上からわずか12%へと減少させた。

研究では、この追加のレイヤーがエージェントの速度をどの程度低下させるかも測定された。結果によれば、システムは極めて高速であり、意思決定にかかる時間に加算されるのは0.25ミリ秒未満であった。つまり、セキュリティチェックはほぼ瞬時に行われ、ユーザーに目に見える遅延を感じさせることはない。ただし、研究者はトレードオフが存在することも発見した。非常に厳格なルールを設定した場合、システムがあまりに慎重すぎて、エージェントが正当なタスクを完了できないケースがあった。テストの結果、最も厳格なルールを適用すると、正当なタスクの成功率は約8.6ポイント低下した。これは、本システムが攻撃を防ぐ上で非常に効果的である一方で、通常の業務を妨げないようにするための細かなチューニングが必要であることを示唆している。

研究者たちは、自分たちのシステムができることとできないことを明確に定義した。ルールが適切に設定されていれば、エージェントが禁止されたアクションの組み合わせを実行することは不可能であることを数学的に証明した。また、任務が階層を下っていくにつれて、侵害されたエージェントから生じる潜在的な被害が増大しないことも証明した。しかしながら、このシステムがすべての問題を修正できるわけではないことも認めている。たとえば、ファイル削除の権限を持つエージェントがファイルを削除するという、単一のアクション自体がすでにルールで許可されている場合、その有害な行為を止めることはできない。また、許可された範囲内での「悪い選択」をするエージェントを止めることもできない。これらの問題には、AIに対するより優れたトレーニングや、扱う具体的なデータに関するより詳細なチェックといった別のアプローチが必要となる。

結局のところ、この論文は、人工知能のセキュリティに対する考え方の転換を提示している。壊れない「心」を作ろうとするのではなく、壊れない「檻」を作ることに焦点を移しているのである。アクションの組み合わせに関する厳格なルールを強制し、タスクが委譲される際に権限が縮小するようにすることで、このシステムは、エージェントの判断力が失われたときでも支えとなる安全性を提供している。この研究は、適切な建築学的コントロールがあれば、複雑な環境においても、一つの混乱が破滅につながることを恐れることなく、強力なデジタル労働者に活動を許可できることを実証している。得られた知見は、安全な人工知能への道は、単により賢明なモデルだけにあるのではなく、モデルが「イエス」と言っている時でも「ノー」と言う術を知っている、より賢明なシステムの中にあることを示唆している。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →