← 最新の論文
🤖 AI

Cochise: A Reference Harness for Autonomous Penetration Testing

本論文は、自律型渗透テストのための分離されたプランナーとエグゼキュータのアーキテクチャを実装する最小限の597行のPythonリファレンスハブ「Cochise」を紹介し、これにより研究者はGame of Active Directory (GOAD) テストベッドに対してLLM駆動のエージェントを評価できるとともに、リプレイ、分析、および軌跡データの共有のためのオープンソースツールを提供する。

原著者: Andreas Happe, Jürgen Cito

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Andreas Happe, Jürgen Cito

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

デジタルの要塞(コンピュータ・ネットワーク)の弱点を見つけるために、ロボットにどのように侵入させるかを教えることを想像してみてください。これは「ペネトレーション・テスト」と呼ばれます。最近、研究者たちはこの作業を自動化するために、超スマートな AI の頭脳(大規模言語モデル)を使い始めました。

しかし、問題がありました。新しいチームが AI ハッカーを構築するたびに、彼らは独自の作業場、ツール、そして規則書を作っていたのです。これは、ガレージで造られた車と、工場で造られた宇宙船を比較するようなもので、宇宙船が速いのはエンジンのおかげなのか、それとも単に車輪が優れていたからなのかを判別できませんでした。

そこで登場するのが「Cochise」です。

Cochise を超スパイではなく、AI ハッカーのための標準化され、透明なトレーニングジムと考えてください。これは、研究者が全く同じ条件下で異なる AI の頭脳をテストできるようにする、小さくシンプルな「ハーネス(ツールと規則のセット)」です。

以下に、日常の比喩を用いてその仕組みを説明します。

1. セットアップ:「ジャンプホスト」

AI が城(ターゲット・ネットワーク)に侵入する必要があると想像してください。しかし、AI を城の門のすぐそばに置くのは危険すぎます。

  • 解決策: Cochise は城の外に安全な**「飛び出し」プラットフォーム(別のコンピュータ)**を設けます。
  • 比喩: AI はコントロールルームに座り、長い安全な無線(SSH)を使って、飛び出しプラットフォームにいるロボットに指示を出します。ロボットはその後、城の中へと入っていきます。
  • なぜか? AI が過ちを犯し、偶然城を爆破してしまった場合でも、破壊されるのはロボットの指示だけであり、AI 自身の頭脳やコントロールルームは守られます。これにより、実験は安全に、かつ封じ込められた状態で行われます。

2. チーム:「プランナー」と「エグゼキューター」

Cochise は AI の頭脳を整理整頓するために、2 つの明確な役割に分割します。

  • プランナー(将軍): この AI の部分は後方に座り、全体像を眺めます。長期的なToDo リスト(城の地図のようなもの)を保持し、次に何を行うべきかを決定します。任務全体を記憶しています。
  • エグゼキューター(兵士): この部分は短期的で焦点が絞られています。将軍から特定の命令(例:「このドアを開けてみろ」)を受け取り、コマンドを実行し、結果を確認します。そして、仕事が完了すると、すべてを忘れます
  • 比喩: 映画監督(プランナー)とスタントダブル(エグゼキューター)を考えてください。監督はシーンを計画します。スタントダブルは危険なジャンプを行い、結果を得てから、監督は次のシーンに向けて黒板をきれいにします。これにより、AI が数時間にわたる過去の記憶に混乱することを防ぎます。

3. 「ブラックボックス」レコーダー

AI が行うすべてのことは、完璧で詳細な日記(JSON ログ)に書き留められます。

  • 比喩: これは飛行機のフライトレコーダーのようです。押されたすべてのボタン、AI が考えたすべての思考、消費した「燃料」(お金やトークン)、そして成功したかどうかを記録します。
  • なぜ素晴らしいのか? 通常、これらの AI ハッカーを研究するには、運営に莫大な費用がかかる巨大で高価なコンピュータ実験室(「GOAD」テストベッド)が必要でした。Cochise は研究者に無料のリプレイキットを提供します。高価な実験室は不要です。「フライトレコーダー」のデータを見るだけで、AI がどのように振る舞い、どれだけの費用がかかり、どこで失敗したかを正確に確認できます。

4. その重要性(「リファレンス・ハーネス」)

著者たちは非常に明確に述べています。**Cochise は世界最高峰のハッカーではありません。**究極のスパイになろうとしているのでもありません。

  • 比喩: これは標準化された定規のようなものです。定規は家を建てるために使うのではなく、他のツールが家をどれほどうまく建てたかを測定するために使います。
  • Cochise は小さく(他のプロジェクトの数千行に比べ、わずか 597 行のコード)、他の研究者が読み、理解し、変更することが容易です。これにより、より華やかなセットアップを持っていたかどうかに左右されず、どの AI モデルが実際に賢いのかを公平に比較することが可能になります。

まとめ

Cochise は、研究者が AI ハッカーを公平にテストできるようにする、シンプルでオープンソースのツールキットです。これは「思考」と「実行」を分離し、実験を安全に保ち、すべての詳細を記録することで、スーパーコンピュータを必要とせずに誰でも結果を研究できるようにします。Cochise は、AI セキュリティ研究という混沌とした世界を、公平で測定可能な科学へと変えるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →