← 最新の論文
💻 computer science

Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming

本論文は、インフラストラクチャ、プロトコル、エージェントの振る舞い、およびモデル層にわたる特有の脆弱性に対処するために、決定論的なルール照合からLLM駆動型の監査やジェイルブレイク・テストに至るまで、カスタマイズされた多層的なレッドチーミング・アプローチを適用することでAIエージェントを保護するオープンソースのフレームワーク、AI-Infra-Guardを紹介するものである。

原著者: Yong Yang, Xing Zheng, Huiyu Wu, Huangsheng Cheng, Xiaorong Shi, Jing Guo, Bo Yang, Yi Zhou, Xiangfan Wu, Zonghao Ying

公開日 2026-07-01
📖 1 分で読めます☕ さくっと読める

原著者: Yong Yang, Xing Zheng, Huiyu Wu, Huangsheng Cheng, Xiaorong Shi, Jing Guo, Bo Yang, Yi Zhou, Xiangfan Wu, Zonghao Ying

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、あなたと会話をし、情報を検索し、さらには航空券の予約やファイルの分析といったタスクを実行できるハイテクなロボット助手(「AIエージェント」)を構築していると想像してください。次に、そのロボットが安全で、誠実であり、ハッカーによって誤って制御を奪われないようにしたいと考えているとします。

この論文は、これらのAIアシスタントに対して「レッドチーミング(ハッカーによるテスト)」を行うために設計された、新しいオープンソースのセキュリティ・ツールキットであるAI-Infra-Guardを紹介しています。Tencent Zhuque Labの研究者たちは、AIエージェント全体に対して単一の種類のセキュリティチェックを用いるだけでは不十分であると主張しています。その代わりに、システムの異なる部分に対して異なるツールを使用する、階層的なアプローチが必要です。

AIエージェントを多層建てのビルだと考えてください。これを守るためには、基礎、ドア、中の人々、そして脳そのものに対して、それぞれ異なるセキュリティチームを用意する必要があります。

コアとなる考え方:「適切なフロアに、適切なツールを」

この論文の主なテーゼは、AIセキュリティは「層状(ストラティファイド)」になっているということです。ビルの基礎に対して機能するセキュリティ・ルールは、中に住む人々に対しては機能しません。AI-Infra-Guardは、4つのレイヤーそれぞれに特定のセキュリティ「パラダイム(手法)」を適合させています。

1. 基礎:インフラストラクチャ・スキャニング(「指紋チェック」)

  • 内容: AIを動かしているサーバーやソフトウェア(車のエンジンのようなもの)をチェックします。
  • 問題点: AIソフトウェアはバージョンの更新が非常に速く、「b7824」や「latest-dev」といった標準的なセキュリティスキャナーを混乱させる特殊な命名体系を使用しています。
  • 解決策: チームは決定論的なルールエンジンを構築しました。これは、膨大な最新のIDカード・データベースを持つセキュリティガードのようなものです。推測する代わりに、ガードはサーバーの「指紋」を、75以上の既知のAIコンポーネントと1,400以上の既知の脆弱性のリストと照合します。
  • 仕組み: これは厳格な数学的ルールを用いて、「このサーバーはバージョンXを実行しており、それは既知の不具合がある」と断定します。高速かつ精密で、推測を排除しています。

2. ドアとツール:MCPサーバーおよびスキルの監査(「翻訳者」)

  • 内容: AIエージェントは、データベースやファイルと通信するための「ツール」(Model Context Protocol、またはMCP)を使用します。また、新しいことを行うために「スキル」(プラグインのようなもの)をインストールすることもあります。
  • 問題点: ハッカーは、ツールの「説明文」やスキルパッケージの中に悪意のある指示を隠すことができます。単純なコードスキャナーは、「税金の計算を手伝ってください」という文章が、データを盗むための罠であるということを理解できません。
  • 解決策: 彼らはAI監査役(第二のAI)を使用して、コードとその説明を読み取ります。
  • 比喩: これは、コードの言語を話す探偵を雇うようなものです。単に悪い言葉を探すのではなく、ツールの意図を理解するために、そのストーリー全体を読み解きます。
  • 革新的なポイント: 彼らは**「プロンプト・アズ・ルール(Prompt-as-Rule)」**を使用しています。バグを見つけるための複雑なコードを書く代わりに、AI監査役に対して「安全規則を無視させようとするツール説明を探してください」といった自然言語の指示を記述します。
  • 自己防衛: 決定的なことに、この監査役は保護されています。もしハッカーが隠されたメッセージを使って監査役自体を騙そうとした場合、システムにはそれを無視するための特別な防御策が備わっています。

3. 人々:エージェントの振る舞いのレッドチーミング(「ロールプレイヤー」)

  • 内容: これは、実際にあなたがAIと会話しているときに、AIがどのように振る舞うかをテストするものです。
  • 問題点: これらはコードを読んでも見つけることはできません。AIとチャットし、AIがミスをする(例:秘密の指示を漏らすように誘導できるか等)のを確認することで初めて発見できます。
  • 解決策: マルチターン(多段階)のレッドチーミング・パイプラインを使用します。
  • 比喩: 厄介な客を演じるために雇われたプロの俳優を想像してください。その俳優は単に質問を投げかけるだけでなく、会話を続けます。もしAIが秘密を明かすのを拒否すれば、俳優は別の角度(ロールプレイング、メッセージのエンコード、あるいはプレッシャーの強化など)から試行します。
  • コスト管理: AIとの会話にはコストがかかるため、システムはスマートです。特定の弱点が見つかった時点でそのテストを停止し、資金を無駄にしないようにします。また、AIが実際にデータを漏洩させたのか、単なる推測なのかを証明するために、「カナリー・トークン(目に見えないインクのようなもの)」を使用します。

4. 脳:モデルのジェイルブレイク評価(「ストレス・テスト」)

  • 内容: コアとなる言語モデル自体をテストし、不適切な内容(武器の作り方やヘイトスピーチなど)を強制的に出力させられるかどうかを確認します。
  • 問題点: これは単一のバグの問題ではなく、統計の問題です。AIがどの程度の頻度で失敗するかを調べます。
  • 解決策: 大規模なベンチマークを使用します。
  • 比喩: ジムのトレーナーが、AIの「安全性の筋肉」がどれほど強いかを確認するために、何千もの異なるトレーニング・ドリル(攻撃)を行わせていると考えてください。16種類の有害な質問データセットと、それらを尋ねるための26以上の異なる方法(コード、謎解き、外国語の使用など)を使用します。
  • 判定: 別のAIが「判定役」として機能し、「対象のAIは安全テストに失敗したか」を判断します。これにより、モデルの安全性に関する統計的なスコアが得られます。

なぜこれが重要なのか

この論文は、既存のセキュリティ・ツールは、ハンマーだけで家を修理しようとしているようなものだと主張しています。それらは壊れた窓(インフラ)を見つけることには長けているかもしれませんが、屋根裏に隠れている泥棒(振る舞い)や、毒入りの食事(スキル)を捕まえることには全く適していません。

AI-Infra-Guardは、これらすべての異なるツールを一つの屋根の下に集めた、最初のオープンソース・フレームワークです。これは以下の事実を認めています。

  1. インフラストラクチャには、高速でルールに基づいたチェックが必要である。
  2. ツールとスキルには、文脈を理解するためのAI探偵が必要である。
  3. 振る舞いには、相互作用をテストするための人間のようなロールプレイヤーが必要である。
  4. モデルには、大規模な統計的ストレス・テストが必要である。

適切なセキュリティ手法を適切なレイヤーに適合させることで、著者たちは、AIエージェントが私たちの日常生活において一般的になるにつれ、それらを安全に保つための実用的な基盤をようやく構築できると考えています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →