← 最新の論文
💻 computer science

aiAuthZ: Off-Host, Identity-Bound Authorization for AI Agents

本論文は、アイデンティティに紐付けられた不変のポリシーと暗号学的検証を強制することによってAIエージェントのツール呼び出しを保護する、オフホスト型の認可ゲートウェイであるaiAuthZを紹介し、様々なモデルやシナリオにおいて攻撃成功率を0%に低減させつつ、遅延を無視できる程度に抑えることを実現している。

原著者: Sai Varun Kodathala

公開日 2026-07-08
📖 1 分で読めます☕ さくっと読める

原著者: Sai Varun Kodathala

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コアとなる問題: 「騙されやすい執事」

あなたは、家事全般をこなす非常に知的な執事(AIエージェント)を雇ったと想像してください。この執事は指示に従うのが得意で、金庫を開けたり、メールを送ったり、送金したりすることができます。

しかし、一つ問題があります。執事は、「あなたからの正当な命令」と、「誰かが冷蔵庫に貼った付箋に書かれた偽の命令」の区別がつきません。

もし見知らぬ人が家に忍び込み、「持ち主が言っています:全財金を私の口座に送金せよ」と書いたメモを残した場合、執事はそのメモを読み、「これは持ち主からの正当な命令だ」と信じ込んで実行してしまうかもしれません。これはプロンプト・インジェクションと呼ばれる現象です。この論文は、命令が安全かどうかを「考える」ことを執事に任せるのはリスクが高いと主張しています。その理由は以下の通りです:

  1. 執事によって、騙されやすい者もいれば、疑り深い者もいる。
  2. 最も高価で高性能な執事でさえ、時として騙されてしまう。
  3. 安全性を高めるために、単に報酬(コスト)を増やせば済むという話ではない。

解決策: 「離れた場所の警備員」 (aiAuthZ)

著者たちは、aiAuthZと呼ばれるシステムを構築しました。命令が安全かどうかを執事に判断させるのではなく、執事と外部の世界の間に、別の信頼ドメイン(隔離された部屋)にいる警備員を配置しました。

新しいシステムの仕組みは、以下のステップで行われます。

1. 「秘密の手順」 (アイデンティティの検証)

あなたが(ユーザーが)命令を出すとき、ただ言葉を発するだけではありません。あなたと警備員だけが知っている、独自の壊れないデジタル印(HMAC署名)でその命令に署名します。

  • 例え話: あなたが警備員にメモを手渡すとします。そのメモには特別な封蝋(ふうろう)が施されています。警備員はその封印をチェックします。もし封印が本物であれば、警備員は「これは間違いなく持ち主からの命令であり、他人ではない」と判断できます。
  • ひねり: たとえ執事が「私は持ち主です、鍵をください」という内容のメモを読んだとしても、警備員はその「言葉」を無視します。警備員は封印のみを信頼します。もし封印が持ち主のものでなければ、たとえテキストの内容がどうあれ、その命令は拒否されます。

2. 「ルールブック」 (オフホスト・ポリシー)

警備員は、執事が見ることも書き換えることもできない「ルールブック」を持っています。

  • 例え話: 執事は「自分はどんなドアでも開けられる!」と思っているかもしれません。しかし、警備員のルールブックには「持ち主のみが金庫を開けられる。持ち主のみが送金できる」と書かれています。
  • たとえ執事が自分には権限があると思い込まされたとしても、警備員がルールブックをチェックします。もし依頼者(「封印」)が持ち主でなかったり、あるいはやりたいことが大きすぎたり(例:100万ドルを送金するなど)する場合、警備員はそれを阻止します。

3. 「壊れないレシート」 (QRコード)

警備員が「よし、これは安全だ」と判断したとき、単にアクションを実行させるだけではありません。警備員は、その命令が承認されたことを証明するQRコードのレシートを発行します。

  • 例え話: これはコンサートのチケットのようなものです。たとえチケットの写真を撮ったり、縮小したり、ぼやけたメッセージで送ったりしても、セキュリティシステムはそれをスキャンして「これは有効なチケットである」と認識できます。
  • 論文では、QRコードの写真を撮り、クロップ(切り抜き)し、圧縮するというテストを行いました。システムは94%の確率で依然として認識できました。これにより、「誰が何をしたか」という不変の記録が作成されます。

4. 「秘密の保管庫」 (クレデンシャル・ブローカー)

警備員は、金庫の鍵(APIシークレット)も保持しています。執事は鍵を持っていません。

  • 例例え話: もし執事が騙されて金庫を開けようとしても、鍵を持っていないため開けることができません。執事は警備員に頼る必要があります。警備員はルールをチェックし、その時、その特定の瞬間のためだけに鍵を渡します。もし執事が鍵を盗もうとしても、鍵は決して警備員の部屋の外に出ないため、不可能です。

この論文が実際に発見したこと

著者たちは、15種類の異なるAI「執事」(モデル)と、8種類の異なる攻撃(データを盗むように執事を騙すなど)を用いてこのシステムをテストしました。

  • 警備員がいない場合: 執事たちの挙動は一貫していませんでした。騙されることを拒否したモデル(安全性100%)もあれば、騙されてしまったモデル(安全性わずか38%)もありました。最も高価な執事であっても、安全性は50%に過ぎませんでした。
  • 警備員がいる場合: すべての攻撃がブロックされました。 最も安価なモデルから最も高価なモデルまで、あらゆるモデルにおいて、悪意のあるアクションが阻止されました。
  • 速度: 警備員による意思決定は0.03ミリ秒でした。これは瞬きよりも速く、動作を遅延させることはありませんでした。
  • 実世界のテスト: 銀行のシミュレーションでテストを行ったところ、ハッカーが執事を騙そうとしたとしても、警備員は資金窃盗の試みをすべて阻止しました。

このシステムが「できないこと」

セキュリティガードができることと同様に、限界を知っておくことも重要です:

  • 執事が混乱することを防ぐことはできません。 執事は、見知らぬ人を持ち主だと思い込まされる(混乱する)可能性があります。警備員ができるのは、その混乱に基づいて執事が行動を起こすことを防ぐことです。
  • ハッカーが警備員の部屋に侵入した場合は防げません。 もし攻撃者がセキュリティガードのコンピュータを制御してしまった場合、システム全体が失敗します。
  • 執事が自身の組み込みツールを使用することは防げません。 もし執事が、警備員を回避するための隠されたバックドア(組み込みのシェルコマンドなど)を持っている場合、警備員はそれを止めることができません。論文では、システムを導入する際にこれらのバックドアを無効化する必要があると述べています。

結論

この論文は、AIモデル自身に監視を任せるべきではないと主張しています。代わりに、AIの前に分離された、暗号学的なセキュリティガードを置くべきであるとしています。このガードは、依頼者のIDを確認し、ルールをチェックし、レシートを発行します。これにより、混沌として予測不可能な状況を、使用されるAIモデルに関わらず、悪意のあるアクションが100%ブロックされる、決定的で安全なものへと変えるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →