← 最新の論文
💬 NLP

Agentic Security: A Systematization of Tools, Failure Modes, and Design Laws for LLM-Driven Penetration Testing

本論文は、実践的な評価を通じてLLM駆動型ペネトレーションテストツールの運用上の失敗を体系化し、Inspectraプラットフォームを例とした堅牢なエージェンティック・セキュリティシステムの構築を導くための、定量的設計法則および四次元摩擦指数を導出するものである。

原著者: Israt Moyeen Noumi, Tarannum Ahmed Nowshin, Md. Mehedi Hasan Nipu, Mohammad Sakib Mahmood, Md. Jakir Hossain, M. F. Mridha

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Israt Moyeen Noumi, Tarannum Ahmed Nowshin, Md. Mehedi Hasan Nipu, Mohammad Sakib Mahmood, Md. Jakir Hossain, M. F. Mridha

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータセキュリティの世界には、悪意のある攻撃者が来る前にシステムに侵入するために、熟練した人間を雇うという長年の伝統があります。ペネトレーションテスターとして知られるこれらの専門家は、ソフトウェア、ネットワーク、クラウドインフラに隠れた欠陥を探し出すことに日々を費やします。彼らは、データの窃盗やシステムの制御奪取を許してしまうような、弱いパスワード、未修正の脆弱性、そしてロジックエラーを探し出します。数十年にわたり、この仕事は手動による人間主導の技術でした。しかし、新たな力がこの分野に参入しました。具体的には、膨大な量のテキストで学習され、人間の言語を理解し生成できるシステムである大規模言語モデル(LLM)が、今やこれらセキュリティ専門家の仕事を担うよう求められています。その構想は、「エージェンティック(agentic)」なシステム、つまり、コードを読み取りネットワークをスキャンするだけでなく、攻撃を計画・実行し、人間が手を貸すことなくレポートを作成することもできるソフトウェアを構築することです。この転換は、セキュリティテストをより速く、より安価にすることを約束しますが、同時に新たな問題も引き起こします。確率に基づいて思考する(確実性ではなく確率で考える)機械に、複雑で危険な仕事を任せると、人間なら決して犯さないような間違いをしたり、さらに悪いことに、見つけた内容について自信満々に嘘をついたりすることがあるのです。

研究チームは、AIセキュリティエージェントが単独で作業させられたときにどのように振る舞うのかを正確に理解するために調査を開始しました。彼らは単に理論的なモデルを構築したのではなく、「Inspectra」と呼ばれる実際の動作するプラットフォームを構築し、さまざまなセキュリティツールに対してその性能を試しました。彼らの目的は、これらのエージェントが「何ができるか」というハイプ(期待)を超えて、問題が発生したときに「実際に何が起きるのか」というハードなエンジニアリングの実態を記録することでした。彼らが発見したのは、技術が壊れているからではなく、設計者が意図しなかった方法で使用されているために、同じ失敗が何度も繰り返されている、黎明期にある規律の姿でした。研究者たちは、最大の障害はAIの知能の欠如ではなく、システムの構築方法における構造の欠如であることを突き止めました。彼らは、AIが記憶しすぎようとしたとき、自らの仕事を判断しようとしたとき、そして制御できない予算を与えられたときに発生する、具体的かつ予測可能な失敗のパターンを特定しました。

チームが直面した最も差し迫った問題の一つは、メモリの問題でした。AIエージェントが、数千行のコードを読み込み、数十のテストを実行しながら、長い調査を開始すると想像してみてください。調査が進むにつれて、その「記憶」の中に保持すべき情報の量が増えていきます。やがと、システムはすべての情報を保持するためのスペースを使い果たしてしまいます。人間的な表現をすれば、これは、話し手が話し続けている間、長い会話のあらゆる詳細を覚えようとしているようなものです。初期の詳細な内容は、単に消え去ってしまうのです。研究者たちは、AIエージェントが一つの長い連続したセッション内で作業を行うと、スキャンの最初期に収集した証拠を必然的に忘れてしまうことを発見しました。レポートを書く段階に達する頃には、実際には一度も開いていないファイルを自信満々に説明したり、数時間前に記録されたものの、すでにメモリから消去されてしまった脆弱性を発見したと主張したりすることがあります。彼らが提案した解決策は、作業を短く明確なフェーズに分割することでした。一つの長い会話の代わりに、システムは一連の短命なエージェントを使用します。各エージェントは作業の小さな一部を行い、その結果を永続的で整理されたファイルに書き込み、そして停止します。次のエージェントは、生データではなく、そのファイルの簡潔な要約のみを読み取ります。このアプローチにより、システムは場所を見失うことなく、より大きなタスクを処理できるようになり、持ち運ぶ必要がある情報を圧縮することで、AIが記憶できる範囲を効果的に拡張します。

もう一つの重大な失敗モードは、システムが自らの成功をどのように判断するかに関わるものでした。AIレッドチーミングツールがシステムを攻略しようとする際、攻撃が実際に成功したかどうかを判断する方法が必要です。研究者たちは、多くの自動化ツールが、たとえ攻撃が失敗していても、特定のキーワードを目にすると「はい、成功しました」と言いたがる傾向があることを発見しました。これが誤報の氾濫を招きました。これを修正するために、チームは二段階の検証プロセスを設計しました。まず、迅速で安価なチェックによって明らかな失敗をフィルタリングします。次に、第一のチェックを通過したものに対してのみ、より慎重な「判定役」がレビューを行います。決定的なのは、この第二の判定役が第一の判定役とは異なる種類のシステムである必要があるということです。もし両方の判定役が同じタイプのAIであれば、彼らは同じ間違いを犯すため、第二のチェックは無意味になってしまいます。異なるシステムを用いて結果を検証することで、チームは誤報を劇的に減らし、最終的なレポートの信頼性を大幅に向上させることができました。また、彼らは微妙で危険なバイアスも発見しました。もし攻撃がシステムにとって理解不能な形で失敗した場合、ソフトウェアはその失敗を「成功」として記録してしまうことがよくありました。これは、最も危険で捉えどころのない攻撃こそが、隠蔽されたり誤ってラベル付けされたりしやすいことを意味しており、偽りの安心感を与えてしまうのです。

研究者たちはまた、コストと制御の問題にも取り組みました。セキュリティツールは予測不可能です。数秒で終わるものもあれば、途中でスタックして数時間動き続け、膨大な金額と計算資源を消費するものもあります。チームは、AIに対してテキスト指示で単に「時間を使いすぎないで」と伝えるだけでは不十分であることを示しました。AIはその指示を無視したり、読んでいる内容に気を取られてルールを忘れてしまったりすることがあります。代わりに、システムには、AIの意思決定プロセスとは外部にある、ハードな「ゲートキーパー(門番)」、つまりコードが必要です。このゲートキーパーは、ツールの実行時間や支出額に対する厳格な制限を強制し、制限に達した瞬間に遮断します。これにより、AIが誤ってプロジェクトを破産させたり、許可されていないサーバーをスキャンしたりすることを防ぎます。研究者たちは、AIが自身の安全性や予算に関する最終的な権限を持つべきではなく、その役割は常に、独立した変更不可能なコードのレイヤーに属すべきであると強調しました。

最後に、チームはツールそのものについても調査しました。彼らは10種類のセキュリティスキャナーをテストし、手動での実行が容易なツールほど、自動化システムでの使用が困難である場合が多いことを発見しました。多くのツールは、人間がログイン画面をクリックし、その後セッションをスキャナーに引き渡すことを前提に設計されています。AIがこれを行おうとすると、ログインプロセスが複雑すぎたり、ツールがログイン状態を維持する方法を理解できなかったりするため、しばしば失敗します。研究者たちは、別のブラウザ自動化ツールがログインを処理し、その後、認証済みのクリーンなリンクのリストをスキャナーに渡すというパターンを開発しました。この単純な役割分担が、統合における多くの頭痛の種を解決しました。また、彼らはAIの安全ポリシーの状況が流動的であることにも注目しました。今日セキュリティテストを許可しているモデルが、プロバイダーのルールの変更によって明日にはブロックしてしまう可能性があります。これは、これらのツールに基づいたシステムを構築する場合、ワークフロー全体を壊すことなく、基礎となるAIモデルを入れ替えられる柔軟性を持たなければならないことを意味します。

論文は、自動化されたセキュリティの未来は、AIをより賢くすることにあるのではなく、その周囲により優れた構造を構築することにあると結論付けています。最も効果的なシステムとは、AIを「強力だが過ちを犯しやすい労働者」として扱い、厳格なルール、短いメモリサイクル、そして独立したチェックによって囲い込んだシステムです。AIは忘れ、間違いを犯し、時には指示を無視するという事実を受け入れることで、エンジニアは現実の世界に対処できる堅牢なシステムを構築できるのです。研究者たちの仕事は、実験的なデモンストレーションから、信頼できる展開可能な製品へと移行するための青写真を提供しており、AIセキュリティエージェントが「欠陥を見つけた」と言うとき、それが本当に欠陥を見つけたのであり、かつ、予算やルールを破ることなくそれを行ったことを保証するものなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →