← 最新の論文
🤖 AI

Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirical Assessment

この実証研究は、Ollamaモデルによって駆動される現在のオープンソースの汎用LLMエージェントは、現実的なサイバーセキュリティのシナリオにおいて、Banditのような既存の静的アプリケーションセキュリティテスト(SAST)ツールに取って代わるには、まだ適していないと結論付けている。

原著者: Derek Yohn, Luke Flancher, Mirajul Islam, Khaled Slhoub

公開日 2026-06-11
📖 1 分で読めます☕ さくっと読める

原著者: Derek Yohn, Luke Flancher, Mirajul Islam, Khaled Slhoub

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

膨大な本のライブラリ(コード)があり、その中に隠されたあらゆる誤字、プロットの矛盾、あるいは危険な秘密を見つけ出さなければならないと想像してください。あなたには、この仕事のために2人の助け手がいます。

  1. ベテラン司書(Bandit): これは伝統的なツールです。彼は「思考」したり「想像」したりはしません。彼には、既知のミスに対する厳格に書き込まれたチェックリストがあります(例えば「裏口を開けっ放しにするな」や「錆びた錠前を使うな」など)。彼は素早く、整然と本をスキャンし、どこに問題があるかを正確に伝えてくれます。退屈ですが、信頼できます。
  2. クリエイティブなインターン(AIエージェント): これは新しい、洗練された大規模言語モデル(LLM)です。インターネット上のあらゆる知識を読み込んだ、優秀な学生のような存在です。チェックリストの代わりに、「危険そうなものを何でも見つけて」という職務記述書を与えられます。彼は想像力を使って、何が間違っている可能性があるかを推測します。

実験
研究者たちは、この2人を対決させることにしました。彼らはスキャンするために、3つの異なる「ライブラリ」(オープンソースソフトウェアプロジェクト)を与えました。

  • 老朽化しているが頑丈なパッケージマネージャー(Yum)
  • 個人の習慣トラッキングアプリ(Beaverhabits)
  • 不適切なログイン試行をブロックするセキュリティツール(Fail2ban)

彼らは、まずベテラン司書にスキャンさせ、本当の問題の「ゴールドスタンダード(黄金律)」となるリストを作成させました。次に、クリエイティブなインターン(Gemma、Llama、Qwenという3つの異なるAIモデルを使用)に同じ仕事をさせました。

何が起きたのか?(結果)

結果は、クリエイティブなインターンにとって悲惨なものでした。以下は、簡単な比喩を用いた内訳です。

  • 「幻覚(ハルシネーション)」の問題: インターンは、存在しない問題を次々と作り出しました。彼はごく普通のコードの一行を見て、「あ、これは秘密のパスワード漏洩だ!」と言いましたが、実際にはそれは標準的な設定に過ぎませんでした。論文では、これを**偽陽性(False Positive)**と呼んでいます。インターンはトラブルを見つけようと熱心になりすぎて、無害なものを危険だと判定してしまったのです。
    • 比喩: それは、赤いリンゴを持っている人を「赤いものは危険だ」という理由で、爆弾を持っていると判断してしまう警備員のようなものです。
  • 「場所を見失う」問題: インターンは、実際に問題を見つけたとしても、それが「どこにあるか」を教えることができないことがよくありました。彼は「コードの中にバグがあります」とは言いますが、「どのファイルですか?どの行ですか?」と尋せると、存在しないファイル名を捏造したり、空の行番号を指したりしました。
    • 比喩: それは、探偵が「泥棒は家の中にいる」と言うものの、「どの部屋ですか?」と尋ねると、泥棒は実際には地下室にいるのに「屋根裏部屋だ」と推測するようなものです。
  • 「機会損失」の問題: インターンは、ベテラン司書が見つけた実際の問題の大部分を見逃しました。彼は実際の問題の約25%しか捉えることができませんでした。
    • 比喩: 司書が100個の誤字を見つけたとき、インターンはそれらのうち25個しか見つけられず、さらに彼が見つけたもののうち50個は、そもそも誤字ですらありませんでした。
  • 「スピード」の問題: ベテラン司書は1分足らずで仕事を終えました。しかし、クリエイティブなインターンは、同じ作業を行うのに数時間(ライブラリごとに1〜4時間)かかりました。
    • 比 Bezug: 司書は高速列車です。インターンは、線路沿いのすべての花を嗅ぎながら進むカタツムリです。

結論
論文は、現時点ではクリエイティブなインターンはベテラン司書の代わりにはなれないと結論付けています。

インターンは物語を書いたりメールを要約したりすることには長けていますが、セキュリティスキャンのような、具体的でリスクの高い仕事においては、現在あまりにも信頼性に欠けています。彼はあまりにも多くの「ノイズ(偽の警告)」を生み出し、多くの真の危険を見逃し、作業に時間がかかりすぎます。

研究者たちは、インターンを司書の「助手」として使うことは可能かもしれないと示唆しています。例えば、司書が見逃したものを特定させるなどの方法ですが、それは人間がインターンの推測をすべてチェックする場合に限られます。しかし、単独のツールとして古い信頼できる手法に取って代わるものとして使うことについては、論文は**「ノー」**と言っています。「幻覚(でたらめを言うこと)」と精度の欠如により、現在のセキュリティ業務を任せるにはリスクが高すぎるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →