← 最新の論文
🤖 AI

CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents

CAGEは、離散的なバインディング障害と連続的な数値ドリフトが組み合わさった条件下でも承認されたアクションが有効であることを保証するために、結合近傍を直接認証することで、カテゴリチャネルと数値チャネルを個別に扱うことから生じる偽陽性を排除する、ツール使用型LLMエージェントのための認証フレームワークである。

原著者: Blaise Delattre, Cong Wang, Yang Cao

公開日 2026-08-03
📖 1 分で読めます☕ さくっと読める

原著者: Blaise Delattre, Cong Wang, Yang Cao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

技術要約: CAGE (Certified Authorization under Typed-Return Uncertainty)

1. 問題提起

本論文は、ツール利用型大規模言語モデル(LLM)エージェントにおける決定的な脆弱性を扱っている。デプロイされたエージェント・ハーネスは、実行時の権限ゲートを用いてツール呼び出しを認可する仕組みをますます採用しているが、これらのゲートは通常、観測されたツールの返り値と提案されたアクションを単一の時点において評価するに過ぎない。これらは、残留結合不確実性(residual binding uncertainty)、すなわち、エージェットによって観測された検証済みレコード(z~\tilde{z})が、軽微なアセンブリの欠陥(例:古いプロベナンス・タグ、スキーマの不一致、またはレースコンディション)や有界な数値ドリフトによって、「正しく結合された」返り値(zz^\star)と異なる可能性を考慮できていない。

核心となる問題は、あるアクションが観測されたレコードの下で安全であり、かつ離散的(カテゴリカル)な摂動および連続的(数値的)な摂動に対する個別のチェックの下でも安全であるように見えても、これらの摂動が結合して発生した場合には安全ではなくなる可能性があることである。著者らはこれを**ジョイント・ギャップ攻撃(joint-gap attack)**と呼んでいる。信頼できないテキストのサニタイズや点的なアクションの評価に焦点を当てた既存の防御策は、これらの特定の意味論的不確実性に対して決定境界を保護できていない。

2. 手法: CAGE

著者らは、認可の対象を観測された点 (z~,a)(\tilde{z}, a) から、結合近傍 Bd,ϵ(z~)B_{d,\epsilon}(\tilde{z}) へとシフトさせる実行時モニターである CAGE (Certified Authorization Gate for Execution) を提案する。アクション aa は、この近傍内のすべての妥当な「正しく結合された」返り値に対して安全である場合にのみ認可される。

結合近傍

近傍は2つの予算(バジェット)によって定義される:

  • 離散予算 (dd): 最大 dd 個の許容可能な結合欠陥(例:単一のプロベナンスの入れ替えやポリシーパックの混乱)を許容する。
  • 連続予算 (ϵ\epsilon): 標準的な検証後の、数値フィールド(例:リスクスコア、金額)における有界な 2\ell_2 ドリフトを許容する。

非構成定理(The Non-Composition Theorem)

中心的な理論的貢献は、チャネルの個別の認証は構成(合成)されないという証明である。

  • 定理 1: ある安全性述語が、元の離散状態に対するすべての連続的摂動の下で安全であり、かつ元の連続値に対するすべての離散的入れ替えの下でも安全であっても、離散的入れ替えと連続的シフトが組み合わさった状態では安全ではない可能性がある。
  • 含意: 周辺的な証明(テキストと数値を別々にチェックすること)は不完全である。防御策は、離散的摂動と連続的摂動の直積を認証しなければならない。

CAGE アルゴリズム

CAGEは、離散近傍の厳密な列挙に続いて、連続ブランチの健全な認証を行うことで動作する:

  1. 列挙 (Enumerate): 離散近傍 Nd(s)={s:Ddisc(s,s)d}N_d(s) = \{s' : D_{disc}(s, s') \le d\} を計算する。
  2. ブランチの認証 (Certify Branches): 各離散近傍 ss' について、アクションが ϵ\epsilon-球内のすべての連続的摂動 xx' に対して安全であることを認証する。
  3. 決定 (Decision): すべてのブランチが連続的認証テストに合格した場合にのみ、アクションを許可する。

仮定の梯子 (Assumption Ladder / Backends)

CAGEは、ポリシーの性質(実行可能か学習されたものか)に応じて異なるバックエンドをサポートする:

  • CAGE-Exact (第1段階): ポリシーが実行可能な述語(例:Regoにおけるアフィン制約や決定テーブル)である場合に使用される。これは ϵ\epsilon-球上の制約に対する厳密な数学的検証を実行する。これは**ポリシー認証済み(policy-certified)**である。
  • CAGE-Lip (第2段階): 学習されたゲート(暗黙的なポリシー)に使用される。1-Lipschitz 連続なニューラルネットワークアーキテクチャを採用する。ゲートの決定を Lipschitz マージン(hθ>Lcertϵh_\theta > L_{cert}\epsilon)に基づいて認証する。これは**ゲート認証済み(gate-certified)**であり、測定されたゲート・ポリシーの忠実度仮定の下で健全である。
  • CAGE-RS (第3段階): ブラックボックス・ゲートに使用される。**ランダム平滑化(Randomized Smoothing)**を適用して、連続的球に対する確率的な保証を提供する。これもゲート認証済みである。

3. 主な貢献

  1. 堅牢な認可の定式化: 本論文は、タイプ付き返り値の不確実性下での決定としてのポスト・ツール・リターン認可を定式化し、返り値に依存する安全性には実現された返り値の検査が必要であることを証明した(命題 1)。
  2. 非構成の証明: 著者らは、カテゴリカルおよび数値的チャネルの周辺的な証明は、それらの結合積における安全性を意味しないことを証明し、「ジョイント・ギャップ・ウィットネス」の存在を特定した(定理 1)。
  3. 仮定の梯子を備えた認証モニター: CAGEは、離散空間を厳密に列挙し、連続空間を(Exact, Lipschitz, Smoothingといった)様々なバックエンドを用いて認証する統一されたフレームワークを提供し、学習されたゲートに対しても健全性の底辺を確保する。
  4. 測定された安全性ケース: 注入された欠陥に基づき較正された厳密な安全性ケースを提供し、CAGEが有用な自律性を維持しつつ、予算内の誤許可(false allows)を排除することを実証した。

4. 実験結果

評価は、合成設定、ポリシー・アズ・コード(Open Policy Agent, GoRules)、規制フレームワーク(PSD2/AML)、および実際の取引データ(IEEE-CIS)にわたって行われた。

  • ジョイント・ギャップ・ウィットネスの存在: 研究により、ジョイント・ギャップ・ウィットネスがすべての設定において存在し、**3.5%から12%**の自然な頻度で発生することが確認された。
  • 健全性 (Soundness): すべての設定において、CAGEは認証済み誤許可(Certified False Allow: CFA)率 0 を達成した。対照的に、点的なゲートや周辺構成のベースラインは、これらの不安全なウィットネスを高頻度で(多くの場合、ウィットネス集合の100%)許容してしまう。
  • 自律性 (Autonomy): 厳格な安全性保証にもかかわらず、CAGEは顕著な自律性を維持している:
    • CAGE-Exact は、ポリシー・アズ・コードの設定で堅牢に安全な決定の**22–34%を、自然なトラフィックでは57%**を自律的にクリアした。
    • 学習されたバックエンド (Lip/RS) は、動作点の厳格さに応じて**6.5–37%**の自律性を維持した。
  • エンドツーエンドの検証: ライブシステム(Kubernetes, MCP書き込みパス, AMLエンジン)のテストにおいて、CAGEは、ゲートなし、あるいは点的なゲートを持つエージェントによって許容された不安全なサイドエフェクト(例:不正なデプロイメント、クォータ超過の書き込み)を正常にブロックした。
  • 適応的攻撃: CAGEは、ポリシーと予算を知っている適応的な攻撃者に対しても健全性を維持するが、学習された点的なゲートは、一部の合成攻撃において高い誤許可率(最大98%)を示す。

5. 意義と主張

本論文は、CAGEが、型付き返り値の不確実性に安全性が依存する決定のための較正された認可メカニズムを提供すると主張している。その意義は以下の通りである:

  • 論理的ギャップの解消: 型付き返り値の結合近傍を正式に認証する初めてのシステムであり、点的な防御や周辺的な防御が見逃してしまう脆弱性に対処している。
  • 実用的なデプロイ可能性: 「仮定の梯子」を提供することで、理論的に完璧な実行可能ポリシーと実用的な学習済みゲートの間の溝を埋め、後者の場合でも明示的な忠実度条件の下で形式的な保証を提供する。
  • 運用の現実性: 本研究は、形式的な保証を運用上の前提条件(例:データの新鮮さ、コンストラクタの完全性)から明確に分離している。これら(前提条件)が失敗した場合の「残留リスク」(例:データの鮮度が宣言された予算を超えた場合)を、絶対的な免疫を主張するのではなく、定量化している。

著者らは外部妥当性の主張について慎重であり、展開型のパイプラインにおけるジョイント・ギャップ攻撃の存在、実現可能性、およびメカニズムを実証しているが、これら特定の欠陥がすべての現実世界のエージェント・システムにおいてどの程度の頻度で発生するかを測定したとは主張していない。彼らは、型付き返り値の不確実性を測定し強制できる場所においては、CAGEが不可欠な実行時制御であると結論付けている。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →