← 最新の論文
💻 computer science

Autonomous LLM Agents & CTFs: A Second Look

本論文は、CTF チャレンジにおいて汎用エージェントである Claude Code が複雑に設計されたアーキテクチャと同等の性能を発揮する一方で、両者とも人間レベルの障壁に直面しており、構造化された多役割オーケストレーションが単一モジュール設計よりも一貫性とコスト効率の面で優れていることを実証することで、攻撃的セキュリティにおける大規模言語モデルエージェントの能力を再評価する。

原著者: Youness Bouchari, Matteo Boffa, Marco Mellia, Idilio Drago, Thanh Minh Bui, Dario Rossi

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Youness Bouchari, Matteo Boffa, Marco Mellia, Idilio Drago, Thanh Minh Bui, Dario Rossi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

デジタル探偵チームが、隠された宝物(「フラグ」と呼ばれる)を見つけるために、一連の施錠されたデジタル金庫(「CTF チャレンジ」と呼ばれる)を突破しようとしていると想像してください。しばらくの間、人工知能(AI)エージェントは非常に賢くなり、人間のプロとほぼ同じレベルでこれを行えるようになっていると主張する人々がいました。

この論文は、「現実確認」レポートのようなものです。著者たちは、AI が本当に本番に耐えられるのか、それとも単に運が良いだけなのかを確認するために、これらの主張を自らテストすることにしました。

以下に、彼らの実験と発見の概要を、日常的な比喩を用いて解説します。

1. 実験:異なる探偵チームの構築

研究者たちは、単一の種類の AI だけを使用するのではなく、どの構造が最も効果的かを確認するために、3 つの異なる「チーム構造」を構築しました。また、有名な市販の AI 探偵であるClaude Codeもテストしました。

  • 単独の探偵(エグゼキューター): 1 人がすべてを行うと想像してください。鍵を見る、計画を立てる、鍵を開ける、宝物が入っているか確認する、といった作業をすべて行います。論文によると、この人物は圧倒され、ミスをしてしまいます。
  • 批評家付きの探偵(エグゼキューター+エバリュエーター): ここでは、探偵が作業を行いますが、2 人目の人物(批評家)が肩越しに見守ります。探偵が鍵を開ける前に、批評家が「待て、それは悪いアイデアだ。やり直せ」と言います。これは役立ちますが、批評家は全体像を見失い、些細な细节を細かく指摘するだけの場合もあります。
  • 戦略家と批評家付きの探偵(プランナー+エグゼキューター+エバリュエーター): これが最も複雑なチームです。
    • 戦略家(プランナー): まず金庫を見て、ステップバイステップの地図を作成します。
    • 探偵(エグゼキューター): 地図に従って行動します。
    • 批評家(エバリュエーター): 地図に対して作業をチェックします。
    • 結果: このチームが最も効率的でした。目的もなくうろうろしなかったため、時間とコストの無駄が最も少なかったのです。

彼らはまた、固定されたチーム構造を持たず、助手を雇うか単独で働くかを自ら決定する「スマートなジェネラリスト」のようなClaude Codeもテストしました。

2. 結果:「30 問中 19 問」という天井

大きなニュースは、チームをどのように組織化しても、AI は明確な天井にぶつかったという点です。

  • スコア: 人間が設計した最良のチームも、スマートな「ジェネラリスト」AI(Claude Code)も、どちらも正確に30 問中 19 問を解決しました。
  • 比較: これは、いくつかの以前の研究が主張していたものよりも低いです。著者たちは、それ以前の研究は楽観的すぎたか、より簡単なテストを使用していた可能性があると示唆しています。
  • 効率性の勝利: スコアは同じでしたが、「戦略家+探偵+批評家」チームは、どのように作業を行ったかにおいて、はるかに優れていました。彼らは単独の探偵よりも少ないステップで済み、実行コストも低かったです。これは、同じ時間でレースを完走する 2 人のランナーが、一人は一直線に走り、もう一人は円を描いて走ったようなものです。

3. AI が行き詰まる場所(「なぜ」か)

研究者たちは、なぜ AI が残りの 11 問で失敗したのかを深く掘り下げて調査しました。彼らは、AI が失敗する理由が 2 つの全く異なるものであることを発見しました。

A. 「ツール不足」の問題(技術的限界)
時には、AI は何をすべきか正確に知っているのに、適切な装備を持っていません。

  • 比喩: AI は鍵を開ける方法を知っているのに、厚手のオーブン用手袋をはめた状態でやろうとしているようなものです。
  • 例: 一部のチャレンジでは、AI がブラウザ内のウェブページを見て(隠されたコードを確認するため)、テキストのみの環境で作業していた必要があります。また、他のものでは、同時に 2 つのことを行う(競合状態など)必要がありましたが、AI は厳密に 1 つのステップずつしか処理できません。

B. 「脳の霧」の問題(認知的限界)
時には、AI はすべてのツールを持っていますが、単に論理を「理解」していません。

  • 比喩: 割れた窓を見つけるのが得意な探偵(技術的ハック)が、配達員に怒ったオーナーが裏口を開けっぱなしにしていること(ビジネスロジック)を完全に見逃しているようなものです。
  • 例:
    • ビジネスロジックの欠陥: AI はウェブサイトの仕組みの物語を理解できなかったため、それを欺くことができませんでした。
    • 長い連鎖: ステップ 20 がステップ 1 に依存する 20 ステップのタスクの場合、AI は混乱し、終わりに到達する頃には物語の始まりを忘れていました。
    • 盲目の推測: いくつかの複雑なパズルでは、AI は考え込むのではなく、時間がなくなるまでランダムなことを試し続けました。

4. 結論

この論文は、AI エージェントは向上しているものの、まだ「人間レベル」には達していないと結論付けています。

  • 良い知らせ: AI に明確な計画とチーム構造(戦略家+探偵+批評家)を与えれば、非常に効率的かつ一貫して機能します。
  • 悪い知らせ: 「ガラスの天井」があります。カスタムチームを使用するか、汎用 AI を使用するかにかかわらず、すべてが同じ地点(30 問中 19 問)で停止します。
  • 真のボトルネック: 主な問題は、AI が計画を実行する方法ではなく、まず第一にどのような種類の問題であるかを認識することに失敗することが多いという点です。AI が脆弱性を正しく特定すれば、通常はそれを解決するのが上手です。しかし、何が問題なのかを理解できない場合、始めることさえできません。

要約すると、AI は非常に効率的な労働者ですが、まだ何の仕事をするべきかを人間に指示してもらう必要があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →