Baselines Before Architecture: Evaluating Coding Agents for Autonomous Penetration Testing
本論文は、自律型ペネトレーションテスト・エージェントの将来的な評価において、アーキテクチャの革新に由来する性能向上と、基礎となるモデルの改善に起因する性能向上を正確に区別するために、制御されたモデル一致のプレーン・エージェント・ベースラインを確立しなければならないと主張するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットを、絶えず変化し続ける巨大なデジタル建築物の街だと想像してみてください。中には、悪意のある者が忍び込むための隠れた罠や壊れた鍵――すなわちセキュリティホール――を持つ建物があります。何十年もの間、これらの穴を見つける仕事は、あらゆる部屋を歩き回り、ドアや窓をテストするデジタル鍵職人のような、人間の専門家の役割でした。しかし、街の成長はあまりにも速すぎます。新しい建物が毎秒のように出現するため、鍵職人たちは追いつけなくなっています。そこで、科学者たちは人工知能(AI)を用いた「ロボット鍵職人」を作り始めました。これらのロボットは、大規模言語モデル(LLM)によって動いています。LLMは、インターネット上のほぼすべての内容を読み込み、コードを書き、問題を推論し、指示に従うことができる、超スマートな脳のようなものです。
この分野における大きな疑問は、「ロボットは鍵を見つけられるか?」ということだけではありません。「ロボットの成功のうち、どれくらいがその『脳』によるもので、どれくらいが与えられた『豪華な道具』によるものなのか?」ということです。あなたが天才的な学生を持っていると想像してください。もし、シンプルなノートとペンを与えたら、彼らは数学の問題を解けるかもしれません。しかし、もしハイテクな計算機と、チューターのチーム、そして特別な地図を与えたら、彼らはより速く問題を解けるでしょう。では、計算機が彼らを賢くしたのでしょうか、それとも単に手助けをしただけなのでしょうか? AIセキュリティの世界では、研究者たちがAIにウェブサイトをハッキングさせるために、AIエージェント、特殊なメモリシステム、検索ツールといった複雑な「ハーネス(装着具)」を構築してきました。しかし、AIの「脳」と「道具」の両方を同時に変え続けてきたため、豪華な道具が実際に主役として機能しているのか、それともAI自体が単に賢くなっているだけなのか、誰も分からなくなっていました。
「Baselines Before Architecture(アーキテクチャの前にベースラインを)」と題されたこの論文は、非常に慎重な実験によって、この論争に決着をつけるべく登場しました。研究者たちは、XBOWベンチマークと呼ばれる104個の標準的なデジタルチャレンジを用いた、制御されたテストを設定しました。彼らは新しい豪華なロボットを作る代わりに、Codex、OpenCode、Piという名前の既存の「プレーンな」コーディング・アシスタントを3つ取り出し、単一の強力なAIの脳(GPT-5)を使用し、特別なセキュリティツールを使わずに、それらの課題を解決するよう求めました。彼らは、余計なガジェットを追加する前に、「裸の」AIがどれほどの成果を出せるかを確認したかったのです。
結果は、驚きと実用的な真実が混ざり合ったものでした。第一に、プレーンなコーディング・エージェントは驚くほど強力でした。「Codex」エージェントは、GPT-5モデル上で動作し、最初の試行で約67%のチャレンジを解決しました。研究者が再度試行させ(同じテストを2回実行し、結果を組み合わせる)、結果を統合したところ、77.9%のチャレンジを解決しました。これは大きな出来事です。なぜなら、複雑なセキュリティチームを必要とせずとも、シンプルな汎用コーディング・ロボットがすでに業務の大部分をこなせることを意味しているからです。
この研究では、多くの人々が不可欠だと考えていた2つの特定のアイデアについてもテストを行いました。一つは、AIに対してハッカーのように考えるよう指示する特別な指示書を与える「セキュリティ・プロンプティング」です。もう一つは、複雑なマルチエージェント・アーキテクチャ(異なる役割を持つAI同士が対話する仕組み)が最高のパフォーマンスを得るために必要であるという考えです。論文によると、特殊な「ハッカーへの指示」は、実際にはAIのパフォーマンスを「低下」させ、解決できるチャレンジの数を減らし、コストを増大させることが判明しました。複雑なアーキテクチャについては、論文の中で、プレーンなCodexの結果を、MAPTAやPentestGPT V2と呼ばれる2つの有名なハイテク・システムと比較しました。
ここで微妙なニュア خلال(ニュアンス)があります。豪華なシステムは、依然としてわずかな優位性を持っていました。同じAIの脳と組み合わせた場合、特化したMAPTAシステムは、プレーンなCodexよりも約9.6パーセントポイント多くチャレンジを解決しました。しかし、論文は、この差が思われているほど巨大なものではないことを示しました。研究者がプレーンなCodexエージェントをより新しくスマートな脳(GPT-5.5)にアップグレードしたところ、新しいエージェントは最初の試行で92.3%のチャレンジを解決し、2回の実行を組み合わせると95.2%に達しました。この新しいプレーンなエージェントは、豪華なツールを持たない状態でも、以前の複雑なシステムのヘッドライン・スコアを上回ったのです。
この論文の主な教訓は、科学界への警告です。「複雑な新しいアーキテクチャが高いスコアを出したからといって、それがヒーロー(主役)だと思い込んではならない」ということです。多くの場合、スコアはツールの豪華さではなく、AIモデル自体の進化によってもたらされます。論文は、新しい「セキュリティ・ハーネス」が画期的であると主張する前に、研究者はまず、全く同じAIの脳を使用したシンプルなプレーンなコーディング・エージェントと比較して、それがどれほど優れているかを示すべきであると示唆しています。特化したツールは、コストや時間の節約に依然として役立つかもしれませんが、「プレーンな」AIはすでに主要な役割を果たしており、単に次の世代のAIモデルを待つことは、より複雑なロボットを作り上げるのと同等に効果的な方法かもしれないのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。