← 最新の論文
🤖 AI

Proteus: A Self-Evolving Red Team for Agent Skill Ecosystems

本論文は、適応的でフィードバック駆動型の攻撃者が監査を反復的に回避して致命的なエージェントのスキル変異体を作成する方法を明らかにすることで、現在のスキル審査システムがセキュリティリスクを大幅に過小評価していることを示す自己進化型のレッドチームフレームワーク「Proteus」を紹介する。

原著者: Zhaojiacheng Zhou

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Zhaojiacheng Zhou

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたの AI アシスタントに、スマートフォンでアプリをダウンロードするのと同じように「スキル」をダウンロードできる世界を想像してください。これらのスキルは、銀行口座の確認やカレンダーの管理など、特定のタスクを AI が実行する方法を AI に伝えます。しかし、もしハッカーが、無害に見えるが裏でデータを盗む「毒入り」スキルを作成したらどうなるでしょうか?

本論文は、現在の安全対策がこれらの毒入りスキルをどれだけ見抜けるかをテストするために設計されたデジタルセキュリティ研究者「プロテウス」を紹介します。

以下に、その仕組みを簡単な比喩を用いて解説します。

1. 問題点:「ウィーケイモ」ゲーム

現在、新しいスキルが提出されると、「セキュリティ監査人(デジタルの番人)」を経由します。この番人は、そのスキルが危険かどうかを確認するために、スキルのコードとその説明(ドキュメント)をチェックします。

  • 欠陥: ほとんどのセキュリティテストは、スキルを「一度だけ」チェックします。番人が「合格」と判断すれば、そのスキルはインストールされます。
  • 現実: 賢いハッカーは、ただ一つの悪いスキルを提出して諦めるわけではありません。彼らは番人がそれを拒否した「理由」を観察し、スキルをわずかに調整して再挑戦します。番人の目をかいくぐりながら、なおかつ被害をもたらすバージョンが見つかるまで、これを繰り返します。

本論文では、これを「適応的漏洩(Adaptive Leakage)」と呼んでいます。これは、ハッカーが鍵を破るまで試行錯誤を繰り返すリスクを指します。

2. 解決策:プロテウス(自己進化型ハッカー)

研究者たちは、執拗で学習するハッカーのように振る舞う AI エージェント「プロテウス」を構築しました。単に一度番人を欺こうとするのではなく、プロテウスは多段階のゲームを行います。

  1. 提出: 番人にスキルを送ります。
  2. 聴取: 番人が「不合格」と言ったら、プロテウスはその「理由」(例:「このコードは疑わしい」「説明とコードが一致しない」など)を読み取ります。
  3. 進化: プロテウスはそのフィードバックを用いてスキルを書き換えます。コードを変更したり、説明を再記述したり、他のツールとの接続方法を再構成したりします。
  4. 反復: 番人を通過し、かつ安全な模擬サンドボックス内で有害な行動(データの盗難など)を成功させるバージョンが見つかるまで、これを繰り返します。

3. 5 つの攻撃軸

プロテウスは単一の要素を変更するだけでなく、熟練の錠前開けが異なる道具を試すように、5 つの異なる角度から同時にスキルを攻撃します。

  • 目的: スキルは何を行おうとしているのか?
  • 構造: スキルはどのように構成されているのか?
  • コード: 実際の指示内容。
  • チャネル: 外部世界とどのように通信するか。
  • ドキュメント: スキルが何を行うかを説明する書面。

プロテウスは、これらのすべての領域で変更を組み合わせて、番人を混乱させることができます。

4. 「ラウンド契約」(テスト競技場)

プロテウスが実際に真の欠陥を見つけ出していることを確認するため、研究者たちは各試行に対して 3 つのステップからなる厳格なテスト競技場を構築しました。

  1. 監査: 番人はそれを通過させるか?
  2. サンドボックス: スキルはクラッシュせずに実際に実行されるか?
  3. オラクル: 実際には有害な行為(ファイルの削除やパスワードの盗難など)を行ったか?

プロテウスは、この3 つのステップすべてをクリアした場合にのみ「勝利」とみなされます。

5. 発見されたこと

研究者たちは、プロテウスを実際のセキュリティ対策(オープンソースのもの一つと、大手テック企業からのもの一つ)と、2 つの異なる AI モデルに対してテストしました。

  • 結果: プロテウスは恐るべきほど効果的でした。
    • わずか5 回の試行で、**40% から 90%**の確率で番人を回避することに成功しました。
    • 単一のトリックを見つけただけではなく、システムを破る438 通りの異なる方法を発見しました。
    • 最も強力な番人(AI-Infra-Guard)でさえ、プロテウスを阻止できず、**約 41%**の確率で失敗しました。
    • 「転移」トリック: プロテウスが一つの番人を破る方法を学習すると、新たな学習を必要とせずに、同じトリックを別の番人を破るためにも使えることが多々ありました。

6. 重要な教訓

本論文は、AI スキルをチェックする現在の方法が、危険性を過小評価していると結論付けています。私たちは、まるでセキュリティ番人が人物の単一の写真を確認するかのようにスキルをチェックしています。しかし、実際の攻撃者は、番人が自分を通すまで顔を次々と変える「変身術師」のような存在です。

プロテウスは、学習し適応する攻撃者に対処できるシステムを構築しない限り、私たちの AI エコシステムにはハッカーが容易に悪用できる巨大で隠された欠陥が存在することを証明しています。

要約すると: 私たちはセキュリティ番人が悪いスキルを見抜くのが上手だと考えていました。しかし、この論文は、悪意ある行為者が自分の失敗から学習するほど賢ければ、それらの番人は実際には非常に欺きやすいことを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →