← 最新の論文
🤖 AI

AgenticRed: Evolving Agentic Systems for Red-Teaming

本論文は、人間の介入なしに進化アルゴリズムを用いて自律的に赤チームシステムを設計・改良する「AgenticRed」を提案し、これにより既存手法を凌駕する高い攻撃成功率と、最新のプロプライエタリモデルへの強力な転移能力を実現したことを報告しています。

原著者: Jiayi Yuan, Jonathan Nöther, Natasha Jaques, Goran Radanović

公開日 2026-04-06
📖 1 分で読めます☕ さくっと読める

原著者: Jiayi Yuan, Jonathan Nöther, Natasha Jaques, Goran Radanović

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「AGENTICRED(エージェンティックレッド)」**という、新しいタイプの AI 安全テストシステムについて紹介しています。

一言で言うと、**「AI の弱点を見つけるための『自動進化型ハッカー』」**を作ったという話です。

以下に、専門用語を排して、身近な例え話を使って解説します。


1. 従来の方法:「マニュアル通りの探検」

これまでの AI の安全テスト(レッドチームング)では、人間が「こうやって攻撃しよう」「この手順で話しかけよう」というマニュアルを一生懸命作っていました。

  • 例え話: 探検家が「北へ 100 歩、東へ 50 歩」という固定された地図を持って森を歩くようなものです。
  • 問題点: 地図が古いと新しい罠(AI の新しい防御策)に見つかりません。また、人間が地図を作るのは時間がかかり、人間の「偏見」が入り込むこともあります。

2. AGENTICRED の方法:「自然淘汰による進化」

この論文のアイデアは、**「人間が地図を作るのをやめて、AI 自体が進化させる」**というものです。ダーウィンの「進化論」を AI の設計に応用しています。

  • 例え話: 森の中に**「100 匹の探検家(AI)」**を放ちます。
    1. 試行錯誤: 彼らはそれぞれ違う方法で森(AI の防御壁)を突破しようとします。
    2. 自然淘汰: 失敗した探検家は「消える」か「リセット」されます。成功して AI の弱点を突けた探検家だけが「生き残ります」。
    3. 遺伝と進化: 生き残った探検家の「成功した作戦」をコピーし、少し変えて(突然変異)、新しい探検家を作ります。
    4. 世代交代: このプロセスを何世代も繰り返すことで、**「最も賢くて、どんな防御も突破できる究極の探検家」**が自然に生まれてきます。

3. このシステムがすごいところ

  • 人間の手を離れる: 人間が「こうしなさい」と指示しなくても、AI 同士が「前回の失敗から学んで、次はこうしよう」と勝手に改良し続けます。
  • 驚異的な成績: 実験では、最新の AI モデル(Llama や Qwen など)に対して、**96%〜100%**の成功率で「安全なはずの AI」に危険な答えを言わせてしまいました。
  • 未知の相手にも強い: 一度作られた「最強の探検家」は、訓練した AI だけでなく、全く新しい AI(GPT-5.1 や DeepSeek など)に対しても、事前の学習なしに強力な攻撃を仕掛けることができました。まるで、どんな城壁も破れる「万能の鍵」を勝手に見つけてしまったようです。

4. 具体的な「進化」の仕組み

システムは以下の 4 つのステップを繰り返します(図 1 の右側をイメージしてください):

  1. アーカイブ(知識の倉庫): 過去の成功例や失敗例を記録します。
  2. 選択(生き残り): 一番うまくいった攻撃パターンだけを選びます。
  3. ガイド(道具): AI に「攻撃対象の AI」と「判定する AI」を使うための道具を与えます。
  4. 世代の記憶(失敗の回避): 「前回ここで失敗したから、次は違う方法で」という知識を次の世代に引き継ぎます。

5. なぜこれが重要なのか?

AI の技術は毎日進歩しています。人間が手動でセキュリティテストをするのは、**「走る速さが速くなる馬に、人間が手動で追いつこうとする」**ようなもので、いつか追いつけなくなります。

AGENTICRED は、**「AI が AI の弱点を見つけ、さらに AI がそれを改良する」という、「AI による AI 監視」**の新しい形を示しました。これにより、新しい AI が登場しても、すぐにその弱点を突き止め、安全対策を講じられるようになります。

まとめ

この論文は、**「人間がマニュアルを作るのをやめて、AI に『進化』させて、最強のセキュリティテストシステムを自動で生み出そう」**という画期的なアプローチを紹介しています。

  • 従来の方法: 人間が作った固定の武器で戦う。
  • AGENTICRED: 戦いながら武器を勝手に進化させ、どんな敵にも勝てる武器を作る。

これは AI の安全性を高めるための強力な新しい武器であり、AI 開発のスピードに追いつくための重要な鍵となるでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →