← 最新の論文
🤖 AI

Evaluating LLM Generated Detection Rules in Cybersecurity

本論文は、ホールドアウトセットの手法を用いて、人間が生成したルールと比較することにより、LLMが生成したサイバーセキュリティ検知ルールの有効性を評価するために設計された、オープンソースの評価フレームワークおよびベンチマーク指標を導入するものである。

原著者: Anna Bertiger, Bobby Filar, Aryan Luthra, Stefano Meschiari, Aiden Mitchell, Sam Scholten, Vivek Sharath

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Anna Bertiger, Bobby Filar, Aryan Luthra, Stefano Meschiari, Aiden Mitchell, Sam Scholten, Vivek Sharath

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットを、メールが郵便システムを通じて旅をする、巨大で賑やかな都市だと想像してみてください。この都市には、偽の手紙や詐欺、ウイルスを親しみやすい手紙に偽装して忍び込ませようとする悪党たちがいます。これらを阻止するために、私たちは「探偵」を雇い、これらの厄介者を特定するための特定のルールを書かせます。例えば、「もし手紙が不審なアドレスから届き、かつ奇妙な添付ファイルが付いている場合は、フラグを立てろ!」というルールです。これらのルールは、私たちのデジタル都市の警備員なのです。

長い間、人間の探偵だけがこれらのルールを書くことができました。彼らは何千通もの手紙を研究し、技術を学び、悪党を捕まえるための正確な指示を書き上げました。しかし最近、新しい種類の探偵が登場しました。人工知能(AI)です。これらのAIエージェントは、指示を読み取り、数秒で独自のルールを書き上げる、超高速の助手のような存在です。大きな疑問は、これらのAIエージェントは本当にその仕事をこなせるのか? ということです。彼らは賢そうなルールを書くだけで、実際の犯罪人を捕まえ損ねるのではないか? あるいは、もっと悪いことに、無実の人々に対して「火事だ!」と叫び始めてしまうのではないか? これが、Sublime Securityの研究チームが解決しようとしたパズルです。彼らは、AIが人間の専門家と同じようにセキュリティルールを書けるのか、そして、そのAIを動かし続けるためにどれほどのコストがかかるのかを知りたいと考えました。

この論文は、ADÉ(アデー)と呼ばれる特定のAIエージェントに焦点を当てた、新しいAI探偵のテスト方法を紹介しています。ADÉは、単一の悪意のあるメールを観察し、将来的に同様の悪質なメールを捕まえるためのルールを書くように設計されています。研究者たちは単に「うまくいったか?」と聞いたわけではありません。彼らは、ルールの性能を測るために、3つの要素を測定する詳細なスコアリングシステムを構築しました。それは、ルールがいかに悪質なメールを捕まえるか(精度)、ハッカーが細部を少し変えたときにルールがいかに壊れにくいか(堅牢性)、そしてAIにルールを書かせるためにどれだけの経済的コストがかかるか(経済的コスト)です。

ADÉをテストするために、研究者たちは人間が書いたルールを使った、巧妙な「かくれんぼ」を行いました。彼らはSublime Securityのコレクションにある優れた人間作成のルールの一覧を取り出し、その中から一つをADÉの記憶から隠しました。次に、その隠されたルールが捕まえるはずの単一の悪質なメールをADÉに見せ、「これを捕まえるためのルールを書いてください」と依頼しました。その後、ADÉが書いたルールを、研究者は45,000通のメールを含む膨大なデータベースを用いて、元の人間によるルールと比較しました。

結果は、目覚ましいスキルと理解可能な限界が混在したものでした。ルールが騙されにくさ(堅牢性)に関して言えば、ADÉは驚くほど優れたパフォーマンスを発揮し、人間の専門家に迫るスコアを記録しました。例えば、隠されたJavaScriptコードを含むメールのテストにおいて、ADেরルールは人間のものと同じくらい突破が困難でした。しかし、ADÉはより慎重でした。人間の専門家は、長年の経験に基づいて何千もの悪質なメールを捕まえるための広範なルールを書く一方で、ADÉは示された単一のメールに基づいた非常に限定的なルールを書きました。その結果、ADÉが捕まえる総数の悪質なメール(真陽性)は少なくなりましたが、同時に、良質なメールに誤ってフラグを立てるミス(偽陽性)も大幅に減少しました。実際、いくつかのテストでは、人間のルールがいくつかの無実のメッセージをフラグ立てしてしまうことがあったのに対し、ADÉのルールは誤報がゼロでした。

この研究は、AIを使用する際の「コスト」についても調査しました。ルールを書くことは無料ではありません。AIがコードを書こうとして失敗するたびに、コンピュータを動かすための費用がかかります。研究者たちは、ADÉが技術的なチェックを通過するルールを書くのに、通常1回から3回の試行が必要であることを発見しました。これは、タスクの複雑さに応じて、成功したルール1つあたり約1.51ドルから5.13ドルという非常に低いコストに相当しました。興味深いことに、AIは人間の作者よりも、自身のロジックを説明する詳細なコメントを記述する傾向があり、それによってルールがより読みやすくなっていました。

最終的に、この論文は、ADÉのようなAIエージェントが高品質なセキュリティルールを書く能力を備えつつあることを示唆しています。特に、誤報を避け、予算内に収まるという点においてです。しかし、彼らはまだ人間の専門家を完全に代替できる段階にはありません。AIは一度に一つのメールしか見ることができないため、数千の事例を研究した後に作成されるような、広範で包括的なルールを書くことに苦労します。研究者たちは、AIは特定のタスクを効率的にこなせる強力なツールであるが、最適なセキュリティとは、AIがルール作成の重労働を担い、人間の専門家が戦略を導いてルールが最大限の脅威を捕まえられるようにする、というパートナーシップから生まれるものであると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →