← 最新の論文
🤖 AI

A Policy Algebra for Trust-Preserving Agentic AI Execution

本論文は、セキュリティ制約と実行時の義務を形式的に合成することで、エージェンティックAIに対する信頼維持型の信頼性エンベロープを定義するポリシー代数を導入し、高いタスク完了率を維持しながら、ほぼすべてのポリシー違反に対してシステムが介入することを可能にし、かつ監査の完全性を保証するものである。

原著者: Bhaskar Tripathi, Anurag Kumar, Ramendra Kumar, Bhavesh Gadhe

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Bhaskar Tripathi, Anurag Kumar, Ramendra Kumar, Bhavesh Gadhe

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の人工知能の世界では、大きな変化が起きつつあります。長年、焦点はテキストを生成したり、質問に答えたり、文書を要約したりできるシステムを構築することにありました。これらのシステムは、あらゆるものを読むことはできるものの、本に触れたり家具を動かしたりすることは禁じられている、非常に博識な司書のようなものでした。今日、「エージェント」としばしば呼ばれる新しい世代のソフトウェアには、その建物の鍵が渡されています。これらのエージェントは単に話すだけでなく、行動します。彼らは社内のプライベートなファイルを探し、メールを送り、データベースを更新し、外部サービスを呼び出し、さらには仕事の一部を他のソフトウェアプログラムに引き継ぐことさえできます。この「考える」ことから「実行する」ことへの能力の変化は、ビジネスにとって信じられないほど強力なものですが、同時に新しい種類の危険をもたらします。間違いはもはや、単なる誤った文章ではなく、ファイルの削除や、機密情報の漏洩、あるいは完了することのないタスクに費やされた予算となってしまうのです。

核心的な問題は、エージェントがルールを破ってでも目標を達成してしまう可能性があることです。例えば、ある作業員が荷物を無事に届けたものの、入ることを禁じられていた鍵のかかった部屋に押し入って達成した、という状況を想像してみてください。かつてのセキュリティシステムは、主に人が建物に入るためのバッジを持っているかどうかを確認していました。しかし、これらのインテリジェントなエージェントにとって、セキュリティチェックは入り口だけでなく、その道のりのあらゆるステップで行われる必要があります。エージェントが意思決定を行うことが許される場合、その決定は、「誰が求めているのか」「どのようなツールを使用しているのか」「どれだけの予算が残っているのか」、そして「人間がそのアクションを承認しているか」と照らし合わせてチェックされなければなりません。このような絶え間ない監視がなければ、強力なツールは、たとえプロセスを開始した人物に善意があったとしても、容易に害を及ぼす可能性があります。

フォルクスワーゲン・デジタル・サービスとスカニアCV ABの研究者たちは、このリスクを管理するための新しい方法を開発しました。彼らはこれを「ポリシー・アルジェブラ(政策代数)」と呼んでいます。これは単なるルールのリストではなく、異なるセキュリティ要件を単一の、破ることのできない意思決定へと組み合わせるための数学的なシステムだと考えてください。研究者たちは、エージェントを信頼するためには、それが生成した最終的な回答だけを見るのではなく、そこに到達するまでの経路全体を見なければならないことに気づきました。彼らのシステムは、エージェントが行おうとするあらゆるアクションを、一連のゲートを通過しなければならない「遷移」として扱います。これらのゲートは、エージェントの身元、役割、触れているデータの機密性、使用しているツール、残りの予算、および人間がその動きに署名したかどうかをチェックします。もし単一のゲートでも失敗すれば、そのアクションは停止されます。

このアプローチの素晴らしさは、特に一つのエージェントが別のエージェントにタスクを依頼する場合の複雑さを処理できる点にあります。現在の多くのシステムでは、タスクが引き継がれる際、セキュリティルールが意図せず弱まり、サブエージェントが元のエージェントには許可されていなかったことをできてしまうことがあります。新しいシステムは、権限が連鎖の中で拡大しないようにすることで、これを防ぎます。つまり、セキュリティプロファイルは、連鎖が進むにつれて厳格になるか、あるいは維持されます。もし上級管理職がジュニア従業員に助けを求めたとしても、そのジュニア従業員が突然、管理職のプライベートなファイルにアクセスできるようになることはありません。また、このシステムは資金も慎重に管理します。エージェントが膨大な計算能力や資金を消費する場合、保存された文書や完了した記録といった、具体的な成果を生み出さなければならないようにします。もしエージェントが有用なアウトプットを残さないまま予算を使い果たした場合、システムはそれを停止させ、会社が成果のないタスクにリソースを浪費することを防ぎます。

この手法がどの程度機能するかをテストするため、研究者たちは、エージェントが様々なタスクを完了しようとする数千のシミュレーションシナリオを実行しました。彼らは、許可されたツールやユーザーの役割に基づいた単純なリストに依存していた古い手法と、新しいシステムを比較しました。その結果、安全性において明確な差があることが示されました。新しいシステムは、古いシステムが見逃した不適切なアクションの94.8%を阻止しました。これには、エージェントがアクセスすべきでないデータへのアクセスや、触れてはいけないツールの使用、あるいはセキュリティルールを回避するような形での他のエージェントへのタスクの受け渡しを防ぐことが含まれます。また、システムは、エージェントがすべての資金を使い果たしながら有用な結果を残さないという特定の種類の失敗も排除しました。追跡に関しては、新しいシステムは監査に必要な詳細の98.6%を記録しましたが、古い手法では71.9%にとどまり、何かが起きた際に何が起こったのかを理解することをはるかに容易にしました。

この追加の安全性にはコストが伴います。新しいシステムは意思決定にわずかに時間がかかり、平均で38ミリ秒であった古い手法に対し、約71ミリ秒を要します。また、安全なアクションを誤って停止してしまうことも、古いシステムの2.1%に対し、4.2%の割合で発生します。これらの追加チェックにより、エージェントがタスクを正常に完了する全体の割合は、90.7%から86.9%へとわずかに低下しました。しかし、研究者たちはこのトレードオフは必要であると主張しています。目標は、最も速い、あるいは最も有能なエージェントを構築することではなく、最も信頼できるエージェントを構築することです。迅速に完了したとしても、不正なデータアクセスや資金の浪費を伴うタスクは、成功とは言えません。

この研究は、インテリジェントなエージェントのためのセキュリティとは、目的地だけでなく、旅のプロセス全体の特性であるということを裏付けています。ルールを組み合わせるこの新しい手法を用いることで、企業は、あらゆるステップが許可され、追跡可能であり、経済的に健全であることを保証しながら、ソフトウェアにより自由な行動を許すことができます。このシステムは、エージェントが何を間違えるかを予測しようとするのではなく、エージェントがすべての瞬間において、明示的に許可されたことのみを行えるような枠組みを作り出しているのです。このアプローチによって、人工知能の生の力を、ミスが現実の結果をもたらす実社会において、企業が実際に信頼して運用できるツールへと変貌させるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →