KYA: A Framework-Agnostic Trust Layer for Autonomous Systems with Verifiable Provenance and Hierarchical Policy Composition
KYA は、エージェントのドリフト、漏洩、敵対的攻撃を検出すると同時に、サブミリ秒の遅延と高スループットを維持するための、セキュアな 4 ゲート適用パイプライン、階層的ポリシー構成、統一された信頼スコアリングを含む 5 つの中核プリミティブを採用する、自律システム向けのオープンソースかつフレームワーク非依存の信頼レイヤーである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたのために働く自律型ロボット(AI エージェント)の艦隊を想像してください。それらは融資の審査を行ったり、医療患者を分類したり、株式を取引したりしています。現在、これらのロボットを監視するために使用するツール(「オプサーバビリティ」と呼ばれるもの)は、車のダッシュボードのようです。エンジンが過熱しているか、車がゆっくり動いているか、部品が故障しているかを教えてくれます。
KYA(Know Your Agents:エージェントを知れ) は、単にエンジンを見守るだけでなく、保安員、探偵、公証人を一身に担う新しいシステムです。ダッシュボードでは答えられない問いに答えます:このロボットは嘘をついているか?軌道から逸れているか?秘密を漏らしているか?そして何か問題が起きた場合、実際に責任を負うのは誰か?
以下に、KYA の仕組みを、日常的な比喩を用いた 5 つの簡単な部分に分けて説明します。
1. 4 つのゲートによるセキュリティチェック(「ボーダー」)
AI エージェントが新しいことを行ったり、ルールを変更したりする前に、4 つの厳格なセキュリティゲートを通過しなければなりません。これは高セキュリティの銀行の金庫のようなものです。
- ゲート 1: キーを持っている人が本当にこのリクエストに署名したか?(デジタル署名チェック)。
- ゲート 2: このリクエストは有効か、それとも期限切れか?(時間チェック)。
- ゲート 3: このリクエストはルールを厳格化するか、緩くするか?KYA はルールが厳格化(安全化)されることのみを許可し、緩めることは許しません。まるで親が「追加の家事を課すことはできるが、すでに課されている家事を減らすことはできない」と言うようなものです。
- ゲート 4: 人間が実際に「はい」と言ったか?デフォルトでは、変更には人間の承認が必要です。
2. 「厳格化のみ」のルールブック(「安全格子」)
ロボットのためのルールブックを持っていると想像してください。会社(プラットフォーム)が基準となるルールを設定します。あなた(テナント)は、その上に独自のより厳格なルールを追加できますが、会社の安全ルールを削除することは決してできません。
KYA は特別な数学的システムを使用して、誰がルールを追加しても、システムが誤って安全性を低下させることがないことを保証します。これは安全ネットの積み重ねのようなものです。ネットを追加することはできますが、底から一つを取り除くことは決してできません。
3. KYP(Know Your Principal:主を知れ)(「ユニバーサル ID カード」)
過去には、人間用の ID カード、ロボット用のスコア、自動化されたスクリプト用のログがそれぞれ別々に存在していました。KYA はこれらを単一の ID カードシステムに統合します。
アクターが人間の従業員であれ、AI ロボットであれ、バックグラウンドスクリプトであれ、KYA は彼らに「信頼スコア」を付与します。ロボットが不正を働けばスコアは低下し、人間がミスを犯してもスコアは低下します。全員を同じように扱うことで、誰が信頼でき、誰がリスクがあるかを容易に把握できます。
4. 「相互作用の乗数」(「危険な組み合わせ」)
単独の行動は問題なくても、2 つの行動を組み合わせると危険になることがあります。
- 例: ロボットに「書き込み」ツールを与えるのはリスクがあります。「プライベートデータ」へのアクセスを与えるのもリスクがあります。
- 乗数: ロボットに書き込みツールとプライベートデータへのアクセスの両方を与えた場合、危険性は単に「リスク+リスク」ではありません。「超危険」です。
KYA はこれらの「危険な組み合わせ」の特別なリストを持っています。それらを検知すると、リスクスコアを乗算して増幅し、この特定の組み合わせには追加の監視が必要だと人間オペレーターに警告します。
5. 「責任のなすり合い」(「指揮者の責任」)
これは最も重要な機能の一つです。「マネージャーロボット」が 3 つの「ワーカーロボット」を雇って仕事をさせたと想像してください。もしワーカーロボットの一つが暴走してデータを盗んだ場合、誰が責任を負うのでしょうか?
- 従来の方法: ワーカーロボットが責められます。マネージャーロボットは無実のままで済みます。
- KYA の方法: マネージャーロボットが責められます。
KYA は、リスクのある労働者を雇った場合、その行動に対してあなたが責任を負うと仮定します。サブエージェントが不正を働けば、システムは即座にマネージャーの信頼スコアからポイントを差し引きます。これにより、マネージャーが「クリーン」なサブエージェントの背後に隠れて汚い仕事をさせることを防ぎます。
証拠の扱い方(「改ざん不可能な日記」)
エージェントが何かを行うたびに、KYA はそれをデジタル日記に記録します。これは単なる通常のログではなく、暗号化された連鎖式日記です。
- 各エントリは、特別な数学的ロック(HMAC)を使用して、直前のエントリとリンクされています。
- 誰かが過去のエントリを変更しようとする(例えばミスを消去するなど)と、ロックが破れ、日記全体が「改ざんされた」としてマークされます。
- これにより、何が起きたか、誰がやったか、いつ起きたかを証明する、法廷で証拠として採用可能な記録が作成されます。
論文が実際に発見したこと
著者たちは、このシステムをいくつかの厳しい課題でテストしました。
- 速度: 驚くほど高速です。エージェントを遅くすることなく、毎秒数千のエージェントをチェックできます。
- 互換性: 15 種類以上の異なる AI フレームワーク(LangChain、CrewAI など)と互換性があります。どのソフトウェアを使用しても構いません。KYA はその上に搭載できます。
- ハッキングテスト: チームは「レッドチーム」のハッカーを雇って、エージェントを欺こうと試みました。KYA は、ハッカーがロボットを連鎖させて足跡を隠すという非常にトリッキーな新しい攻撃タイプを含め、攻撃の**89%**を検知しました。
- 現実世界のシナリオ: 模擬銀行融資システムと病院のトリアージシステムでテストされました。どちらの場合も、リスクのあるエージェントを正常に特定し、不正な行動を正しい人物(またはロボット)に遡って追跡することに成功しました。
結論
KYA はオープンソースツール(無料で使用可能)であり、AI エージェントと現実世界の間にあるものです。AI が機能しているかどうかを伝えるだけでなく、AI が安全で、誠実で、説明責任を果たしているかどうかを伝えます。AI がミスを犯した場合、誰を責任追及すべきかを正確に把握し、それを証明する改ざん不可能な記録を確保することを保証します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。