CTIFoundry: An Agent-Native Corpus Scaffold for Cyber Threat Intelligence
本論文は、決定論的なオントロジーグラフとスパンに接地されたレポートを通じてサイバー脅威インテリジェンスの潜在的な構造を具現化する、エージェントネイティブなコーパス・スカフォールドであるCTIFoundryを紹介するものであり、これは従来のフラットな検索基盤と比較して、エージェントによる調査の性能と効率を大幅に向上させるものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
デジタル世界において、セキュリティの専門家は、誰がどのように攻撃しているのかという手がかりを常に追い求めています。サイバー脅威インテリジェンスとして知られるこの業務は、さまざまな企業や組織によって書かれた膨大なレポートの集合体に依存しています。長年、これらのレポートを人工知能で利用する標準的な方法は、それらを整理されていない本のライブラリーのように扱うことでした。コンピュータプログラムが質問を投げかけると、システムはテキスト内で最も似たような単語を検索し、数ページを抜き出します。この手法は単純な質問にはうまく機能しますが、異なる文書間で点と点を結びつける必要がある調査においては苦戦します。ある一つのハッカーグループが、3つの異なるレポートの中で3つの異なる名前で呼ばれていることがあり、特定のソフトウェアの欠陥と既知の攻撃手法を結びつける公式の記録は、しばしば長い段落の奥深くに埋もれています。コンピュータがこれらの隠れたつながりを見ることができなければ、たとえその人工知能プログラムがいかに賢かったとしても、パズルを解くことはできません。
研究チームは、問題はコンピュータの知能ではなく、情報の保存方法にあることを発見しました。彼らは「CTIFoundry」と呼ばれる新しいシステムを構築しました。これは、コンピュータが読み始める前に、セキュリティレポートを整理するための特化したフレームワークとして機能します。データを単なるテキストの塊として放置するのではなく、このシステムはまず事実の明確なマップを構築します。4つの主要なセキュリティデータベースからの公式記録を取り込み、どのソフトウェアの弱点がどの攻撃パターンにつながるのかを正確な線で結びつけます。次に、乱雑なベンダーレポートを読み取り、既知のグループや欠陥に言及している特定の文章を見つけ出し、元のテキスト内の正確な位置にタグを付けます。このプロセスにより、平坦な文書の山が、あらゆる情報がその隣人とソースを知っている構造化されたネットワークへと変わります。
研究者たちは、同じ人工知能エージェントに対して、同じセキュリティデータへの2つの異なるアクセス方法を与えることで、この新システムをテストしました。一つのシナリオでは、エージェントは従来の整理されていない方法を使用しました。もう一方では、新しい構造化されたマップを使用しました。結果は驚くべきものでした。エージェントが新しいシステムを使用したとき、研究者がより小さく、より強力でないコンピュータモデルを使用した場合であっても、正解を答える能力が大幅に跳ね上がりました。実際、新しいマップを使用した小さなモデルは、古い未整理のテキストの山を使用した最も強力なモデルよりも優れたパフォーマンスを発揮しました。この向上は、コンピュータがより懸命に検索したり、より多くのページを読んだりしたためではありません。反対に、新しいシステムを使用するエージェントは、情報の検索試行回数を約半分に減らしながら、正しい答えを見つけ出したのです。それは単に、従うべきより良い経路を持っていただけでした。
この研究はまた、なぜ古い方法が頻繁に失敗したのかをも明らかにしました。あらかじめ構築されたマップがないと、コンピュータはテキストの中で迷子になり、行き止まりや混乱を招く結果につながる似た単語を検索してしまうことがよくありました。専門家がすでに書き記していた公式のリンクも、長い文章の中に隠されていたために見逃されてしまうことがありました。新しいシステムは、コンピュータに公式のつながりを最初に辿るよう強制し、テキストを主要なガイドとしてではなく、詳細のための二次的なソースとして扱います。このアプローチは非常に効果的であり、研究者たちは、データの構造がコンピュータモデル自体の生のパワーよりも重要であることを証明しました。明確なマップを持つ小さなモデルが、乱雑なマップを持つ巨大なモデルを上回ったのです。
システムの信頼性を確保するため、研究者たちは、事実を捏造することを防ぐ厳格なルールを組み込みました。マップ内のすべての接続は公式の記録に基づかなければならず、レポートから抽出されるすべてのテキストは、元のドキュメント内の正確な場所を指し示していなければなりません。これにより、コンピュータが物事をでっち上げたり、答えを推測したりすることはできなくなりました。システムには、公式のマップを確認してから似た単語を検索するといった、コンピュータが従うべき単純な指示、すなわち「習慣」も含まれていました。これらの習慣と明確なマップが組み合わさることで、「相乗効果(super-additive effect)」が生じました。つまり、両者が単独で機能する場合よりも、組み合わさったときにより高い効果を発揮したのです。
この新しいシステムを構築するためのコストは驚くほど低く、初期データの処理に必要な計算能力もわずかでした。一度構築されれば、システムは質問1件あたり約2セントで複雑な調査を解決することができました。研究者たちは、情報が高度に構造化され、公式のつながりに依存している分野においては、最大のボトルネックは人工エージェントの知能ではなく、与えられるデータの質であると結論付けました。データをエージェントが自然に理解し、横断できる形式に整理することで、システムは調査プロセスをより速く、より安く、そしてより正確にしました。この研究は、将来、専門分野における人工知能を向上させる最も効果的な方法は、より賢い脳を作ることではなく、彼らが読むためのより優れたライブラリーを作ることである可能性を示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。