CTIConnect: A Benchmark for Retrieval-Augmented LLMs over Heterogeneous Cyber Threat Intelligence
本論文は、9つの異種混合なサイバー脅威インテリジェンス(CTI)タスクにわたって検索拡張型LLMを体系的に評価するために設計された包括的なベンチマークおよび評価ハーネスであるCTIConnectを紹介し、効果的なパフォーマンスには汎用的な検索の改善ではなく、ドメイン固有の構造的介入が必要であることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、複雑な犯罪を解決しようとしているサイバーセキュリティの探偵であると想像してください。あなたには膨大な手がかりのライブラリがありますが、それらは全く異なる5つの言語や形式で書かれています。あるものは、ソフトウェアのバグのデータベースのような、厳格でテクニカルなスプレッドシートです。またあるものは、異なる記者によって書かれた、犯罪者のニックネームやスラングを用いた、長く乱雑なニュース記事です。
これが**サイバー脅威インテリジェンス(CTI)**の世界です。問題は、人間が手動ですべてを読み解き、点と点を結びつけるには情報が多すぎるということです。
ここで**大規模言語モデル(LLM)**が登場します。これらのAIモデルを、あらゆるものを読み、理解することができる、非常に優秀で超高速な探偵だと考えてください。しかし、一つ問題があります。これらのAIには「メモリの限界」があることです。彼らは毎日出てくる新しい脅威のレポートをすべて暗記することはできません。もし最新のレポートをまだ「読んで」いない場合、新しいウイルスについて質問しても、答えを間違えてしまう可能性があります。
これを解決するために、私たちは**検索拡張生成(RAG)**を使用します。これは、AI探偵に「魔法の図書カード」を与えるようなものです。質問を受けると、AIはまず図書館へ走り、最も関連性の高い文書を掴み取り、その上で、今読んだ内容に基づいて回答します。
問題点:「翻訳の齟齬」というギャップ
この論文の著者たちは、CTIConnectを発見しました。単にAIに図書カードを渡すだけでは不十分であることを彼らは突き止めました。なぜなら、その図書館はめちゃくちゃだからです。
- 語彙の不一致: ある文書ではハッカー集団を「APT29」と呼び、別の文書では「Cozy Bear」と呼び、さらに別の文書では「Nobelium」と呼んでいるかもしれません。もしあなたが「APT29」に関するすべてのレポートを探すよう求めたとしても、標準的な検索では、他の名前しか使っていないレポートを見逃してしまう可能性があります。
- フォーマットの不一致: ある文書には「攻撃者はメモリからパスワードを盗んだ」と書かれている一方で、テクニカルなデータベースには「T1003.001 – LSASS Memory」とリストされているかもしれません。AIはこれらが同じものであることに気づけない可能性があります。
この論文は、標準的な検索ツール(単に似た言葉を探すだけのもの)は、ここでは失敗すると主張しています。それらは、言葉通りの逐次翻訳しかできない、意味や「ニックネーム」を理解していない翻訳者のようなものです。
解決策:CTIConnect
チームは、AI探偵がこの乱雑で多言語なライブラリをいかに検索できるかを検証するための、新しいベンチマーク(標準化されたテスト)であるCTIConnectを構築しました。
彼らは、主に以下の3つのタイプの探偵業務をカバーする、1,860件の専門家による検証済み質問を作成しました。
エンティティ・リンキング(点と点を結ぶ):
- タスク: 「このソフトウェアのバグ(CVE)は、どの特定の脆弱性(CWE)によって引き起こされているか?」
- 比喩: 特定の車種をエンジンの種類に一致させること。AIは、2つの異なるテクニカルカタログの間で「翻訳」を行う必要があります。
- 修正策: AIは、検索を行う前に、質問をデータベースが使用している正確なテクニカル用語へと「翻訳」する必要があります。
エンティティ・アトリビューション(犯人の特定):
- タスク: 「あるレポートに『悪党は.cuba拡張子でファイルを暗号化した』とある。これはどの具体的なハッキング手法を説明しているか?」
- 比喩: 目撃者の記述(「彼は赤い帽子を被って速く走っていた」)を読み、警察のファイル(「容疑者:ジョン・ドゥ、走行が得意」)と照合すること。
- 修正策: AIは文章を小さな、原子的なアクションへと分解し、それぞれの要素を公式の警察コードへと翻訳しなければなりません。
マルチドキュメント合成(物語を構築する):
- タスク: 「5つの異なるニュースメディアからのレポートを組み合わせ、ハッカー集団『APT29』のプロフィールを作成せよ。」
- 比喩: 5人の異なる目撃者が同じパーティーについて説明している状況です。一人は主催者を「ボブ」と呼び、もう一人は「ボビー」、さらにもう一人は「ボス」と呼んでいます。AIは、物語を一つのタイムラインにまとめる前に、これらが全員同じ人物について話していることを理解しなければなりません。
- 修正策: AIは、読み始める前に「ボブ = ボビー = ボス」であることを理解できるほど賢くなければなりません。
彼らが発見したこと
研究者たちは、この新しいテストを用いて、10種類のAIモデル(フリー・オープンソース系と、高価・プロプライエタリ系の両方)をテストしました。以下が彼らの主な発見です。
- 万能な解決策は存在しない: 「ワンサイズ・フィッツ・オール(万能型)」の検索戦略は惨めに失敗しました。テクニカルなバグを検索する最適な方法(エンティティ・リンキング)は、ハッカーのニックネームを検索する最適な方法(マルチドキュメント合成)とは全く異なります。
- 特化したツールが勝つ: AIに特化した戦略(「まず質問を翻訳する」や「文章をパーツに分解する」など)を与えると、AIのパフォーマンスは劇的に向上しました。時には**35%**も向上しました。一方で、標準的な検索ツールによる性能向上は、ごくわずか(1〜5%)でした。
- ボトルネックの移動:
- テクニカルなリンキング・タスクにおいては、問題は検索ツールにありました。一度AIが正しい文書を見つけてしまえば、たとえ「小さな」AIであっても正しく回答できました。
- 命名およびストーリー構築タスクにおいては、問題はAIの脳にありました。たとって正しい文書を手に入れても、文脈を理解し、エイリアス(別名)を繋ぎ合わせるためには、AI自身が非常に賢い必要がありました。
- 大きな脳よりもスマートな検索: 一部のタスクでは、「特化した検索ツール」を併用することで、「巨大で高価な」AIを使うよりも、「より小さな」AIの方がうまく機能しました。これは、常に最も高価なAIが必要なわけではなく、情報を探すための「正しい方法」が必要であることを意味しています。
結論
論文は、効果的なAIセキュリティツールを構築するためには、単に大きなAIモデルや汎用的な検索エンジンに頼るだけでは不十分であると結論づけています。私たちは、サイバーセキュリティの世界特有の「方言」や「ニックネーム」を理解する、特化した検索システムを構築する必要があります。
このように考えてください。犯罪を解決するために必要なのは、より大きな図書館ではなく、たとってタイトルが話の通じないコードで書かれていたとしても、正しい本を正確に見つけ出すことができる「司書」なのです。CTIConnectは、その司書を構築するための地図とテストを提供します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。