CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability
本論文は、コードエージェントの脆弱性検出能力を大幅に向上させるために、希薄な CVE メタデータを高品質で実行可能なセキュリティタスクへ自動的に変換するマルチエージェントフレームワーク「CVE-Factory」を導入し、LiveCVEBench ベンチマークおよび大規模なトレーニングデータセットを構築するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが警備員だと想像してください。100 万枚の異なるドアの壊れた鍵を修理する方法を、新しいロボットに教えようとしています。問題は、手元にある指示が「ドア 404 は壊れている」とだけ書かれた、小さくて曖昧な付箋しかなく、それがどのように壊れているか、ドアがどのような外観か、修理に必要な道具が何かについては何も教えてくれないことです。
これが現在の AI セキュリティ研究の状況です。脆弱性のリスト(CVE と呼ばれる)はありますが、それらは単にまばらなデータポイントに過ぎません。AI エージェントにそれらを修理させるためには、完全な「トレーニングキット」が必要です。つまり、壊れたドアの動作モデル、それが壊れていることを証明するテスト、そして検証済みの解決策です。
CVE-Factoryは、超効率的で自動化された建設チームのように機能する新しいシステムです。それは、その小さくて曖昧な付箋を受け取り、即座にロボット用の完全な動作するトレーニングキットを構築します。
以下に、簡単なアナロジーを用いてその仕組みを説明します。
1. 問題:「曖昧な付箋」
現在、セキュリティの専門家はこれらのトレーニングキットを手動で構築しなければなりません。彼らは脆弱性レポートを読み、ソフトウェアを見つけ、偽のコンピューター環境をセットアップし、意図的にそれを壊し、その破損を検知するテストを書き、そして修正策を書きます。
- 現実: これには専門家 1 人あたりドア 1 枚につき 10 時間以上かかります。何千ものドアに対してこれを行うには、遅すぎて費用もかかります。
- 結果: AI ロボットには練習材料が不足しており、そのためセキュリティの分野では未熟なままです。
2. 解決策:「組み立てライン」(CVE-Factory)
著者たちは、コンベアベルトを備えた専門工場のようなCVE-Factoryを構築しました。1 人の人間が全体の作業を行うのではなく、プロセスを 6 つの明確なステーションに分割し、それぞれを専門化された AI エージェントが担当します。
まるで、1 人のメカニックが一度にすべてを行おうとしないハイテク自動車修理店のようなものです。
- ステーション 1:探偵(アナライザー)
AI は曖昧な付箋を読み、ウェブ検索を行って設計図、特定の車種、そして壊れている正確な部品を見つけます。そして明確な「事件ファイル」を作成します。 - ステーション 2:建築家(ジェネレーター)
この AI は事件ファイルを用いて、ロボットへの指示を書き出します。「これが壊れたドアです。これがその破損を証明するテストです。これが完璧な修正策の姿です。」 - ステーション 3:建設業者(ビルダー)
この AI は実際の環境を構築します。Docker コンテナを使用して、実際のソフトウェアと全く同じように見える「偽のコンピューター」をセットアップします。重要なのは、解決策やテストを見ることなくこれを構築し、不正を防ぐことです。単に舞台を構築するだけです。 - ステーション 4:検査員(バリデーター)
誰かが修理を試みる前に、このエージェントは確認します。「この偽の部屋でドアは実際に壊れていますか?テストは機能しますか?」もし部屋のセットアップが正しければ、それをビルダーに送り返して再構築させます。 - ステーション 5:メカニック(ソルバー)
このエージェントは指示に従ってドアを修理しようとします。パッチを適用し、テストを実行します。 - ステーション 6:品質管理責任者(チェッカー)
最終ボスです。完全なエンドツーエンドのチェックを実行します。修正は実際に機能しましたか?ロボットは偶然他の何かを壊していませんか?テストは本物ですか、それともロボットが単に結果を偽装しただけですか?
秘密の武器: いかなるステーションでも問題が発生した場合、システムは単に諦めるわけではありません。「フィードバックループ」を持っています。もし検査員が「ドアは壊れていない」と言えば、それは新しい人物ではなく、ビルダーに送り返してドアを再構築させます。これにより、最終製品の高品質が保証されます。
3. 結果:専門家レベルの速度
チームは、すでに 215 のトレーニングキットを構築済みの人間専門家に対して、この工場をテストしました。
- 精度: 工場のキットは、人間専門家のキットの95% に相当する品質でした。
- 速度: 人間はキット 1 つあたり 5〜24 時間かかります。工場は約48 分で完了します。
- 規模: 20 人の作業者が同時に稼働することで、工場は 215 個のキットを 5 時間未満で構築しました。人間のチームであれば数週間かかっただろうにです。
4. 新しい遊び場:LiveCVEBench
工場がこれほど高速であるため、著者たちは 215 個で止まることはありませんでした。彼らはLiveCVEBenchと呼ばれる、常に更新される新しい遊び場を構築しました。
- 190 の実世界のセキュリティタスクを含みます。
- 14 種類の異なるプログラミング言語(Python だけではありません)をカバーします。
- AI ツール自体の脆弱性など、新興の脅威を含みます。
- 時間的に固定された古いベンチマークとは異なり、新しい脆弱性が発見されるたびに自動的に更新されます。
5. ロボットの訓練
最後に、彼らは工場を使って AI モデル(Qwen3-32B)を訓練するための 1,000 以上のトレーニングタスクを作成しました。
- 訓練前: AI はセキュリティタスクのわずか**5.3%**しか解決できませんでした。
- 訓練後: それは**35.8%**まで跳ね上がり、はるかに大きくて高価なモデルを凌駕しました。
- ボーナス: 学習したスキルはセキュリティに限らず、一般的なコーディングタスクの能力も向上しました。
まとめ
CVE-Factoryは、高品質なセキュリティ訓練データの作成を自動化するマルチエージェントシステムです。それは、まばらで退屈な脆弱性レポートを、AI エージェント向けの完全なインタラクティブな「脱出ゲーム」スタイルの課題に変換します。複雑な仕事をより小さく専門化されたステップに分割し、AI エージェントに協働させることで、人間が決して追いつくことのできない規模と速度で専門家レベルの訓練データを生成できることを証明しています。これにより、これまで以上に迅速に、より賢く、より安全な AI エージェントを訓練することが可能になります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。