← 最新の論文
🤖 AI

Snyk VulnBench JS 1.0: Can LLMs Find the Same Bugs Twice?

本論文は、エージェンティックなLLMが既知の脆弱性を再現する際には高い安定性を示す一方で、新たな問題を発見する能力は極めて不安定であることを実証しており、LLMベースのセキュリティレビューは決定論的な静的アプリケーションセキュリティテスト(SAST)を置き換えるのではなく、それを補完的なものにすべきであることを示唆している。

原著者: Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair

公開日 2026-06-16
📖 1 分で読めます☕ さくっと読める

原著者: Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、非常に厳格でルールを遵守するセキュリティガード(SASTと呼びましょう)と、非常に優秀で創造的ですが、時々注意が散漫になる探偵(LLMと呼びましょう)を雇いました。二人は、小さなJavaScriptの建物の中に隠された罠(脆弱性)を調査するために雇われました。

論文「Snyk VulnBench JS 1.0」は、シンプルですが極めて重要な問いを投げかけています。もし、この二人を全く同じ建物に5回連続で送り込んだとしたら、毎回まったく同じ報告書を提出するでしょうか?

以下に、日常的な概念を用いて、彼らが発見した内容をまとめます。

1. 厳格なガード vs. 創造的な探偵

  • 厳格なガード (SAşT): このツールは、チェックリストを持つロボットのようなものです。コードが変わっていない限り、ロボットは毎回まったく同じ報告書を出します。彼は決して疲れず、注意が散漫になることもなく、同じものを見逃すことも二度とありません。この研究において、彼は100%一貫していました。
  • 創造的な探偵 (LLM): これは、「思考」し「推論」することができるAIです。ロボットが見逃してしまうような、トリッキーで奇妙な罠を見つけるのが得意です。しかし、人間と同じように、鋭い時もあれば、疲れている時もあり、時には実際には存在しないものを見ていることもあります。

2. 「5回のテスト」

研究者たちは、AI探偵を5回連続でコードの調査に送り込みました。その結果、以下のことが分かりました。

  • AIが「既知の」罠を見つけた場合: もしAIが、厳格なガードがすでに特定していた罠を見つけた場合、その信頼性は非常に高いものでした。AIは、その同じ罠をほぼ毎回(8%の確率で)特定できました。ルールに同意している時は、非常に一貫していました。
  • AIが「新しい」罠を見つけた場合: ここで事態はややこしくなります。AIは、厳格なガードが見ていない新しい、ユニークな罠を報告し始めました。
    • 問題点: これらの「新しい」報告のほぼ半分は、一度きりの珍しい現象(ワンヒット・ワンダー)でした。それらは5回の実行のうちのたった1回にのみ現れ、その後消えてしまいました。
    • 例え: 探偵が月曜日に「廊下に幽霊を見た!」と言い、火曜日には「いや、幽霊はいませんでした」と言い、水曜日には「実は、ただのコート掛けでした」と言い、木曜日には再び「幽霊だ!」と言うようなものです。もしあなたが建物のオーナーなら、怖がるべきなのか、それとも彼女がただ何かを空想しているだけなのか、判断に迷うことになります。

3. 「ノイズ」の要因

研究によると、AIの「追加の」報告は非常にノイズが多いことが分かりました。

  • 「一度きり」の報告: AIが報告したユニークな事柄の約50%は、一度しか発生しませんでした。もし5回のスキャンを実行した場合、どの回の結果を手に取るかによって、得られる「追加の」警告リストは完全に変わってしまいます。
  • 安定した報告: AIと厳格なガードが一致した内容は安定していました。それらは変化しませんでした。

4. 「大きいことは必ずしも良いとは限らない」

研究者たちは、より「高価で、よりスマートな」バージョンを含む、さまざまな種類のAIを試しました。

  • 結果: 最も高価で強力なAIが、最も優れた仕事をしたわけではありませんでした。実際には、そのAIはよりコストがかかり、より多くのコンピュータパワーを消費し、かつ、より安価で小さなバージョンよりも一貫性が低かったのです。
  • 教訓: たとえ「最も賢い」探偵に高いお金を払ったとしても、それが必ずしも最も信頼できる報告をもたらすとは限りません。時には、よりシンプルで焦点の絞られた探偵の方が、一貫性があるのです。

5. 強みと盲点の違い

この論文は、どちらか一方を選ぶのではなく、両方が必要であると結論付けています。

  • 厳格なガードは、すべてのパイプや配線に漏れがないかを系統的にチェックすること(データの流れの繰り返しを確認することなど)に長けています。彼は同じ漏れを二度と見逃しません。
  • 創造的な探偵は、チェックリストには載っていないような、複雑で奇妙なパターン(SQLインジェクションのように見える怪しい動きなど)を見つけるのが得意です。
  • 落とし穴: 探偵は、ガードが捉えるような明白で繰り返される漏れを見逃すことがあり、また、偽の罠に混乱することもあります。

まとめ

もしAI探偵だけに頼ると、チェックするたびに異なるセキュリティ報告書を受け取ることになり、どの「幽霊」が本物で、どれが単なる「コート掛け」なのかを判断するために、多大な時間を費やすことになるでしょう。

もし厳格なガードだけに頼ると、トリッキーで創造的な罠を見逃してしまうかもしれません。

最善の戦略: 厳格なガードを使って、明白で繰り返される漏れを捉え(なぜなら彼は意見を変えないからです)、創造的な探偵を使って、トリッキーで珍しい事象を見つけ出すことです。ただし、探偵の「追加の」発見については、それが一時的な現象である可能性があるため、ダブルチェックを行う準備をしておいてください。彼らは、互いに取って代わるのではなく、互いに助け合うとき、最も効果を発揮します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →