あなたは、あなたと会話をし、情報を検索し、さらには航空券の予約やファイルの分析といったタスクを実行できるハイテクなロボット助手(「AIエージェント」)を構築していると想像してください。次に、そのロボットが安全で、誠実であり、ハッカーによって誤って制御を奪われないようにしたいと考えているとします。
この論文は、これらのAIアシスタントに対して「レッドチーミング(ハッカーによるテスト)」を行うために設計された、新しいオープンソースのセキュリティ・ツールキットであるAI-Infra-Guardを紹介しています。Tencent Zhuque Labの研究者たちは、AIエージェント全体に対して単一の種類のセキュリティチェックを用いるだけでは不十分であると主張しています。その代わりに、システムの異なる部分に対して異なるツールを使用する、階層的なアプローチが必要です。
AIエージェントを多層建てのビルだと考えてください。これを守るためには、基礎、ドア、中の人々、そして脳そのものに対して、それぞれ異なるセキュリティチームを用意する必要があります。
コアとなる考え方:「適切なフロアに、適切なツールを」
この論文の主なテーゼは、AIセキュリティは「層状(ストラティファイド)」になっているということです。ビルの基礎に対して機能するセキュリティ・ルールは、中に住む人々に対しては機能しません。AI-Infra-Guardは、4つのレイヤーそれぞれに特定のセキュリティ「パラダイム(手法)」を適合させています。
1. 基礎:インフラストラクチャ・スキャニング(「指紋チェック」)
- 内容: AIを動かしているサーバーやソフトウェア(車のエンジンのようなもの)をチェックします。
- 問題点: AIソフトウェアはバージョンの更新が非常に速く、「b7824」や「latest-dev」といった標準的なセキュリティスキャナーを混乱させる特殊な命名体系を使用しています。
- 解決策: チームは決定論的なルールエンジンを構築しました。これは、膨大な最新のIDカード・データベースを持つセキュリティガードのようなものです。推測する代わりに、ガードはサーバーの「指紋」を、75以上の既知のAIコンポーネントと1,400以上の既知の脆弱性のリストと照合します。
- 仕組み: これは厳格な数学的ルールを用いて、「このサーバーはバージョンXを実行しており、それは既知の不具合がある」と断定します。高速かつ精密で、推測を排除しています。
2. ドアとツール:MCPサーバーおよびスキルの監査(「翻訳者」)
- 内容: AIエージェントは、データベースやファイルと通信するための「ツール」(Model Context Protocol、またはMCP)を使用します。また、新しいことを行うために「スキル」(プラグインのようなもの)をインストールすることもあります。
- 問題点: ハッカーは、ツールの「説明文」やスキルパッケージの中に悪意のある指示を隠すことができます。単純なコードスキャナーは、「税金の計算を手伝ってください」という文章が、データを盗むための罠であるということを理解できません。
- 解決策: 彼らはAI監査役(第二のAI)を使用して、コードとその説明を読み取ります。
- 比喩: これは、コードの言語を話す探偵を雇うようなものです。単に悪い言葉を探すのではなく、ツールの意図を理解するために、そのストーリー全体を読み解きます。
- 革新的なポイント: 彼らは**「プロンプト・アズ・ルール(Prompt-as-Rule)」**を使用しています。バグを見つけるための複雑なコードを書く代わりに、AI監査役に対して「安全規則を無視させようとするツール説明を探してください」といった自然言語の指示を記述します。
- 自己防衛: 決定的なことに、この監査役は保護されています。もしハッカーが隠されたメッセージを使って監査役自体を騙そうとした場合、システムにはそれを無視するための特別な防御策が備わっています。
3. 人々:エージェントの振る舞いのレッドチーミング(「ロールプレイヤー」)
- 内容: これは、実際にあなたがAIと会話しているときに、AIがどのように振る舞うかをテストするものです。
- 問題点: これらはコードを読んでも見つけることはできません。AIとチャットし、AIがミスをする(例:秘密の指示を漏らすように誘導できるか等)のを確認することで初めて発見できます。
- 解決策: マルチターン(多段階)のレッドチーミング・パイプラインを使用します。
- 比喩: 厄介な客を演じるために雇われたプロの俳優を想像してください。その俳優は単に質問を投げかけるだけでなく、会話を続けます。もしAIが秘密を明かすのを拒否すれば、俳優は別の角度(ロールプレイング、メッセージのエンコード、あるいはプレッシャーの強化など)から試行します。
- コスト管理: AIとの会話にはコストがかかるため、システムはスマートです。特定の弱点が見つかった時点でそのテストを停止し、資金を無駄にしないようにします。また、AIが実際にデータを漏洩させたのか、単なる推測なのかを証明するために、「カナリー・トークン(目に見えないインクのようなもの)」を使用します。
4. 脳:モデルのジェイルブレイク評価(「ストレス・テスト」)
- 内容: コアとなる言語モデル自体をテストし、不適切な内容(武器の作り方やヘイトスピーチなど)を強制的に出力させられるかどうかを確認します。
- 問題点: これは単一のバグの問題ではなく、統計の問題です。AIがどの程度の頻度で失敗するかを調べます。
- 解決策: 大規模なベンチマークを使用します。
- 比喩: ジムのトレーナーが、AIの「安全性の筋肉」がどれほど強いかを確認するために、何千もの異なるトレーニング・ドリル(攻撃)を行わせていると考えてください。16種類の有害な質問データセットと、それらを尋ねるための26以上の異なる方法(コード、謎解き、外国語の使用など)を使用します。
- 判定: 別のAIが「判定役」として機能し、「対象のAIは安全テストに失敗したか」を判断します。これにより、モデルの安全性に関する統計的なスコアが得られます。
なぜこれが重要なのか
この論文は、既存のセキュリティ・ツールは、ハンマーだけで家を修理しようとしているようなものだと主張しています。それらは壊れた窓(インフラ)を見つけることには長けているかもしれませんが、屋根裏に隠れている泥棒(振る舞い)や、毒入りの食事(スキル)を捕まえることには全く適していません。
AI-Infra-Guardは、これらすべての異なるツールを一つの屋根の下に集めた、最初のオープンソース・フレームワークです。これは以下の事実を認めています。
- インフラストラクチャには、高速でルールに基づいたチェックが必要である。
- ツールとスキルには、文脈を理解するためのAI探偵が必要である。
- 振る舞いには、相互作用をテストするための人間のようなロールプレイヤーが必要である。
- モデルには、大規模な統計的ストレス・テストが必要である。
適切なセキュリティ手法を適切なレイヤーに適合させることで、著者たちは、AIエージェントが私たちの日常生活において一般的になるにつれ、それらを安全に保つための実用的な基盤をようやく構築できると考えています。
技術要約: AI-Infra-Guard
問題提起
OllamaやvLLMといったモデルサービングエンジン、DifyやLangFlowといったエージェントプラットフォーム、そしてModel Context Protocol (MCP) エコシステムを含む、オープンソースのAIインフラストラクチャの急速な普及は、防御的なセキュリティツールの開発を追い越してしまいました。この新しいクラスのネットワーク露出型ソフトウェアは、特有の課題を提示しています。すなわち、それらのコンポーネントはあまりに新しいために従来の脆弱性データベースにカタログ化されておらず、セマンティックバージョニングの比較ロジックを無効にする不規則なバージョニングスキームを利用しており、古典的なWebアプリケーションとは異なる脅威モデルに直面しているという点です。
決定的なことに、AIシステムにおけるリスクは、以下の4つのレイヤーに層別化されています:
- インフラストラクチャ (Infrastructure): コンピューティングへの未認証アクセス、認証情報の漏洩、およびサーバーの設定ミス。
- プロトコル/ツール (Protocol/Tool): MCPサーバーの欠陥、ツールのポイズニング(毒入れ)、およびコマンドインジェクション。
- エージェントの振る舞い (Agent Behavior): プロンプトリーク、ツールの悪用、および間接的プロンプトインジェクションといったランタイムの脆弱性。
- モデル (Model): アライメントの失敗およびジェイルブレイク(脱獄)への脆弱性。
本論文は、単一の検出パラダイム(例:静的なルールマッチングやブラックボックス・テスト)だけでは、この異種混合的な攻撃対象領域をカバーするには不十分であると主張しています。従来のツールは、新しいAIコンポーネントのシグネチャを持たず、不規則なバージョニングを処理できず、また注入型の欠陥ではなくAIエージェント固有のセマンティックおよび行動的なリスクに対して調整されていないため、失敗します。
メソドロジー:レイヤー・パラダイム・マッチング
AI-Infra-Guardの核心となるテーゼは、レイヤー・パラダイム・マッチング原則 (Layer-Paradigm Matching Principle) です。効果的なアセスメントには、発見を確立するために必要な証拠の種類に基づいて、特定の検出パラダイムをAI攻撃対象領域の各階層に適合させることが必要であるという考え方です。
本フレームワークは、セキュリティアセスメントを4つのモジュールに整理し、それぞれが異なるパラダイムを採用しています。
1. インフラストラクチャ・スキャニング (決定論的ルールマッチング)
- 対象: 既知のコンポーネント、CVE、および観測可能なシグネチャ。
- パラダイム: カスタムGoエンジンを用いた決定論的なルールベースのマッチング。
- メカニズム:
- フィンガープリント作成: 正規表現だけでなく、ブール式言語を使用して、75のAIコンポーネントをカバーする107のフィンガープリント・ルールのコーパスに対して、レスポンスボディ、ヘッダー、アイコン、およびハッシュを照合します。
- バージョン正規化: 不規則なAIバージョニング(例:
b7824のようなビルド番号やdevタグ)に対処するため、比較前に文字列を正規化し、標準的なセマンティックバージョニングの限界を克服します。
- 精度の層別化: 発見事項は、Verified(機密コンテンツの直接的な観察)、Version-based(CVEマッチング)、Inferred(バージョン不明時のコンポーネント・アイデンティティのみ)の信頼度によって階層化されます。
- 範囲: 1,443以上の脆弱性ルールをカバーします。
2. MCPサーバー・オーディティング (LLM駆動型エージェンティック分析)
- 対象: コードまたはメタデータのセマンティックな理解を必要とするプロトコル/ツール層の欠陥。
- パラダイム: 「プロンプト・アズ・ルール (Prompt-as-Rule)」アプローチを用いた、LLM駆動型のエージェンティック・オーディティング。
- メカニズム:
- エージェンティック・ハーネス: 多段階のパイプライン(情報収集 → コード監査 → レビュー)であり、LLMが推論コアとして機能し、限定された「Reason-Act」ループと特定のツール(例:
read_file, grep)によって制約されます。
- モード: 静的ホワイトボックス(ソースコードの分析)と、動的ブラックボックス(ツールメタデータと実行を通じたライブエンドポイントの分析)をサポートします。
- プロンプト・アズ・ルール: 脆弱性の知識は、過剰な報告を防ぐための明示的な除外条件を伴う自然言語の検出基準としてエンコードされます。
- 自己防衛: オーディターは、スキャナー自体を標的とした間接的プロンプトインジェクション攻撃を防ぐため、分析対象のアーティファクトを「信頼できないデータ」として扱います。
3. エージェント・スキル・スキャニング (サプライチェーン・オーディティング)
- 対象: エージェントによってインストールされるポータブルなスキルパッケージ(例:
SKILL.md マニフェスト)。
- パラダイム: エージェンティック・パイプラインによる制御されたセマンティック・セキュリティ分析。
- メカニズム:
- パイプライン: 前処理 → 静的リスク手がかりの検索 → AIオーディティング・エージェント → リスク分類。
- 分析: LLMは、ターゲットコードを実行することなく、サプライチェーン・ポイズニング、隠蔽されたプロンプトインジェクション、および権限昇格を検出するために、スキルパッケージ全体に対して推論を行います。
- 統合: 外部の脅威インテリジェンスAPIを活用して疑わしいURLや依存関係を検証し、誤検知を低減します。
- 出力: スキルを「Normal(正常)」「Suspicious(疑わしい)」「Malicious(悪意がある)」に分類します。
4. AIエージェント・レッドチーミング (マルチターン・ブラックボックス相互作用)
- 対象: デプロイされたエージェントにおけるランタイムの行動的脆弱性。
- パラダイム: LLM駆動型のマルチターン・レッドチーミング。
- メカニズム:
- 敵対的ダイアログ: エージェントは会話を通じてターゲットと相互作用し、「Reason-Act」ループを使用して、攻撃をエスカレートさせます(例:直接的なクエリからロールプレイやエンコーディングによるバイパスへ)。
- コスト制御: 能力認識(無関係なテストのスキップ)、エスカレーション・ラダー、および停止ルールを採用することで、金銭的コストやレート制限を最小限に抑えます。
- 目的のアンカリング: 主観的な行動判断を決定論的な検証に変換するために、「カナリアトークン」(例:SSRFトークン、仕掛けられたマーカー)を使用します。
- 範囲: データ漏洩、ツール悪用、間接的インジェクション、および認可バイパスの4つのリスクファミリーをカバーします。
5. LLMジェイルブレイク評価 (統計的ベンチマーキング)
- 対象: モデルのアライメントの堅牢性。
- パラダイム: モデルベースの判断を伴う大規模な攻撃列挙。
- メカニズム:
- 3つの役割: シミュレーター(攻撃を生成)、ターゲット(評価対象)、およびジャッジ(成功を判定)。
- 攻撃ライブラリ: 16のデータセット(約7,200のプロンプト)にわたる26以上の攻撃オペレーター(エンコーディング、ロールプレイ、ツリー・オブ・アタックなど)を統合しています。
- 出力: 攻撃成功率と安全性スコアを生成し、モデルの堅牢性の統計的な比較を可能にします。
主な貢献
- 統一されたフレームワーク: AI-Infra-Guardは、AI攻撃対象領域の全4レイヤー(インフラストラクチャ、プロトコル/ツール、エージェントの振る舞い、モデル)を単一のアーキテクチャの下でカバーする最初のオープンソースフレームワークとして提示されています。
- レイヤー・パラダイム・マッチング原則: 本論文は、ヘテロジニアス(異種混合)なAIシステムには、適切な証拠クラス(シグネチャ、セマンティック、行動、統計)を適切な検出パラダイムに適合させる、ヘテロジニアスなアセスメント戦略が必要であるという理論的枠組みを明確にしています。
- スキル・サプライチェーンの監査: エージェントのスキルパッケージを監査するための新しいモジュールを導入し、これまで監視されていなかったベクトルに対処しています。
- プロンプト・アズ・ルール・パラダイム: 検出知識を、LLMの推論能力に適応可能な、明示的な除外条件を伴う自然言語の基準としてエンコードします。
- 自己防衛メカニズム: スキャナー自体をターゲットとして扱い、監査ツール自体を狙った間接的プロンプトインジェクション攻撃に対する防御(信頼できないデータの取り扱い、パス・サンドボックス)を明示的に実装しています。
- オープンソースでのリリース: ルール・コーパス、攻撃オペレーター、および検出モジュールを含むフレームワークを、コミュニティの基盤として活用するためにオープンソースで公開します。
結果と評価
- スキル検出ベンチマーク: 本論文は、62,652の現実世界のスキルから派生した5,520の評価ケースを持つベンチマーク SkillTrustBench を導入しています。
- 結果は、強力なベースモデル(例:Claude Opus 4.6)と組み合わせた場合、スキャナーが Loose F1スコア 0.9848、再現率(Recall)0.9974を達成することを示しています。
- この研究は、検出ハーネスが監査仕様とベースモデルの能力を効果的に分離していることを実証しており、基礎となるモデルの改善が、監査ロジックを変更することなく、直接的に検出性能の向上につながることを示しています。
- システムアーキテクチャ: システムは、分散型サーバー・エージェント・アーキテクチャを介して、ヘテロジニアスなタスク(ミリ秒単位のルールマッチングから数分間のLLMレッドチーミングまで)を正常にオーケストレーションし、結果とコストメトリクスのリアルタイム・ストリーミングを提供します。
重要性と主張
本論文は、AI-Infra-Guardが、従来のツールの「ワンサイズ・フィッツ・オール(画一的)」なアプローチを超え、AIセキュリティにおける決定的なギャップを埋めるものであると主張しています。その重要性は以下の点にあります:
- 実践的な基盤: セキュリティ実務者が、多様なリスクに対して単一の手法を強制するのではなく、「適切なレイヤーに適切なツール」を適用できる、動作可能で拡張可能なプラットフォームを提供すること。
- コミュニティの基盤: AIエコシステムが進化するにつれて、コミュニティが構築を進めていけるような、共有されたオープンソースの基盤を確立すること。
- 包括的な視点: インフラストラクチャ・スキャニング、MCPオーディティング、スキル・サプライチェーン分析、エージェント・レッドチーミング、およびモデル・ジェイルブレイク評価を、単一の結束したシステムへと統合している唯一の既知のオープンソースフレームワークであること。
著者らは、本研究を単なる孤立したツールの集合体としてではなく、一つの設計原則の具現化として位置づけています。すなわち、AIの攻撃対象領域の多様性は、共通のワークフローとアーキテクチャによって統一された、多様な検出パラダイムを要求するという原則です。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録