Co-RedTeam: Orchestrated Security Discovery and Exploitation with LLM Agents
Co-RedTeamは、実行に基づいた推論、構造化された相互作用、および長期記憶を備えたLLMを活用することで、現実世界のレッドチーミングのワークフローを模倣し、自動化された脆弱性の発見および悪用において既存のベースラインを大幅に上回る、セキュリティを意識したマルチエージェントフレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
巨大で複雑な家(ソフトウェアのコードベース)を想像してみてください。あなたは、泥棒がどのように侵入できるか、あらゆる可能性を見つけ出したいと考えています。従来であれば、セキュリティの専門家チームを雇い、すべての部屋を歩き回り、すべての窓をチェックし、すべての鍵を開けようと試みる必要がありました。これには膨大な時間がかかり、多額の費用がかかり、規模を拡大することも困難です。
この論文は、Co-RedTeamという新しいシステムを紹介しています。これは、人工知能(具体的には大規模言語モデル、LLM)を使用して、自動化された超スマートなセキュリティ専門家チームとして機能するものです。単一のAIが何が間違っているかを推測するのではなく、Co-RedTeamは、実際の人間によるレッドチーミング・チームと同じように、連携して動く特化したAIエージェントのグループを組織します。
仕組みを、シンプルな比喩を用いて分かりやすく解説します。
旧来のAIセキュリティツールの問題点
従来のAIによるハッキングの試みは、単一のロボットに地図を与え、「弱点を見つけろ」と命じるようなものでした。
- 問題点: ロボットはしばしば推測を誤ったり、行き詰まったり、あるいは自分の計画が実際に機能するかどうかを確認せずに、ただ侵入を試みたりしました。それらには「グラウンディング(接地性)」、つまり自分のアイデアが現実の世界で実際に機能しているかどうかを確認する能力が欠けていました。また、過去の試行から学んだことを忘れてしまいました。
Co-RedTeamの解決策:専門的なSWATチーム
Co-RedTeamは、単独行動の狼ではなく、調整されたSWATチームとして機能することでこの問題を解決します。これは、「オーケストレーター(指揮官)」によって管理される2つの主要なフェーズに分かれています。
フェーズ1:探偵作業(脆弱性の発見)
侵入を試みる前に、チームは「どこ」を見るべきかを知る必要があります。
- アナリスト・エージェント: このエージェントは、虫眼鏡を持った探偵のようなものです。単にコードを読むだけでなく、特殊なツールを使用して、設計図(ファイル構造)を閲覧し、ルール(CWEやOWASPなどのセキュリティ文書)をチェックしながら、家全体(コードベース)を探索します。そして、鍵が弱くなっている可能性を示唆する手がかりを探します。
- クリティック(批判)・エージェント: このエージェントは、懐疑的な編集者のようなものです。アナリストが潜在的な弱点を見つけると、クリティックは「本当にそうか?証拠を見せろ」と言います。もし証拠が不十分であれば、クリティックはアナリストに、もっと徹底的に調べるよう指示を戻します。このやり取りによって、誤報に時間を浪費することを防ぎます。
フェーズ2:侵入(反復的なエクスプロイト)
潜在的な弱点が見つかったら、チームはそれが実在することを証明するために、実際に侵入を試みます。
- プランナー(計画)・エージェント: このエージェントは戦略家です。壁に盲目的に石を投げつけるのではなく、「ステップ1:窓を開ける。ステップ2:梯子を登る」といった段階的な計画を立てます。
- エグゼキューション(実行)・エージェント: これは、安全で隔離されたサンドボックス(ターゲットのデジタルシミュレーション)の中で、実際に計画を実行する「筋肉」です。コードやコマンドを実行して、侵入が成功するかどうかを確認します。
- エバリュエーション(評価)・エージェント: このエージェントは結果を監視します。「窓は開いたか?アラームは鳴ったか?」と判断します。そしてプランナーに対し、「窓が内側からロックされていたため、失敗した」と伝えます。
- ループ: プランナーはこのフィードバックを聞き、計画を更新します(「なるほど、代わりに裏口を試そう」)。そしてチームは再び試行します。彼らは、侵入に成功するか、あるいは不可能であることを証明するまで、計画を洗練し続けます。
秘密兵器:「経験ノート」(長期記憶)
Co-RedTeamの最も大きな革新の一つは、その長期記憶です。
- 比喩: 人間の専門家が、事件を解決した後に、「ドアがロックされているときは、取っ手ではなく、郵便受けの鍵穴を試せ」といったメモを日記に書く様子を想像してください。
- 仕組み: Co-RedTeamは、以下の3種類のメモを保存します。
- パターン: 「この種のコードには、通常この特定の弱点がある」
- 戦略: 「この種のシステムに対処する場合、まずは設定ファイルを確認することから始める」
- テクニカルなトリック: 「この特定のコマンドは、あのファイアウォールをバイパスするために有効だった」
- 結果: システムはタスクをこなしていくにつれて、より賢くなります。毎回ゼロから始めるのではなく、過去の成功と失敗から学び、より速く、より効果的に新しい脆弱性を見つけ出せるようになります。
研究結果
研究者たちは、CyBenchやBountyBenchといったいくつかの困難なサイバーセキュリティの課題に対して、Co-RedTeamをテストしました。
- 成功率: このシステムは、テストされたケースの60%以上において、脆弱性を発見し、悪用することに成功しました。
- 改善: 他のAI手法(成功率が10%を下回るものもあります)と比較して、大幅に優れた性能を示しました。
- なぜ機能したのか: 論文では、チームのいずれかの要素(クリティック、プランナー、またはメモリ)を取り除くと、システムの性能が著しく低下することが示されました。魔法は、これらのすべてのパーツが、計画、テスト、学習のループの中で連携して動くことで生まれるのです。
まとめ
Co-RedTeamは、システムをハッキングしようとして混乱している単一のロボットから、高度に組織化され、自己改善を行うセキュリティチームへとアップグレードしたようなものです。専門家をコーディネートするチームリーダーを使い、自らの仕事を検証し、あらゆる試行から学び、現実世界でのテストを用いて発見を証明することで、従来のAIツールよりもソフトウェアの弱点を見つける上ではるかに効果的になっています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。