← 最新の論文
💻 computer science

Cybersecurity AI (CAI) Dataset

本論文は、現実世界のサイバーセキュリティ分野における大規模な LLM 相互作用コーパスである CAI データセットを導入し、専門オペレーターの行動経路という決定的なボトルネックを浮き彫りにするとともに、最先端モデル API プロバイダー内に機密性の高い攻撃・防御データを集中させることによるシステムリスクを軽減するため、オンプレミスかつプライベートにホストされたモデルの緊急の必要性を強調するものである。

原著者: Víctor Mayoral-Vilches

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Víctor Mayoral-Vilches

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

サイバーセキュリティの世界を、毎日何百万人もの人々が参加する、巨大で高賭けのチェスゲームだと想像してみてください。一部のプレイヤーは城を守る「ブルーチーム(防御側)」であり、他のプレイヤーは侵入を試みる「レッドチーム(攻撃側)」です。長らく、これらのプレイヤーは自らの頭脳と手動ツールを用いてゲームを行ってきました。

最近、彼らは新しい、超スマートなアシスタントを使い始めました。**人工知能(AI)**です。しかし、問題がありました。AI は賢かったものの、専門家たちが実際にどのようにゲームをプレイしているかを理解していなかったのです。AI はルールを知っていましたが、手練手管、ミス、あるいは戦いの熱気の中で人間が用いる messy(ごちゃごちゃした)で現実的な戦略については知らなかったのです。

本論文は、AI に真のサイバーセキュリティ専門家のように思考することを教えるために設計された大規模なライブラリ、CAI データセットを紹介します。以下に、簡単な言葉でその概要を説明します。

1. 問題:「専門家」のギャップ

AI モデル(あなたがチャットするものなど)を、世界のすべての教科書を読み込んだ天才的な学生だと考えてみてください。しかし、サイバーセキュリティに関しては、彼らは巨匠たちの仕事ぶりを見ていなかったため、失敗していました。

  • 発見: 研究者たちは、AI が失敗した理由は賢さが足りないからではなく、真の専門家たちの「筋肉記憶」が欠如していたからだと発見しました。AI には、行き詰まり、タイプミス、そして「ひらめき」の瞬間を含む、人間がシステムをハッキングしたり防御したりする際の実際のステップバイステップのログを見る必要がありました。

2. 解決策:「ブラックボックス」レコーダー

これを修正するために、著者たちはCAI(Cybersecurity AI)と呼ばれるツールを構築しました。このツールを、人間専門家と AI の間に設置される透明なガラス箱だと想像してください。

  • 仕組み: 人間専門家が CAI ツールを使って仕事をする際(テストシステムのハッキング、バグ修正、ネットワーク防御など)、このツールはすべてを記録します。人間が入力するすべてのコマンド、使用するすべてのツール、犯すすべてのミス、そしてそれを修正する方法を書き留めます。
  • 収集: 14 ヶ月以上にわたり、このツールは123 か国16,000 人の異なる人物から230,000 セッションを記録しました。これは2,600 万のプロンプト(指示)18 テラバイトのデータに相当します。これは、10 億回のチェスゲームのすべての手を記録したようなものです。

3. ライブラリの中身

これは単なる「良い」答えのリストではありません。これは、実際の仕事をありのままに、フィルターなしで見たものです:

  • 善と悪: データの約**36%**は攻撃的(侵入を試みる攻撃者)、**20%**は明確な悪意、**27%**はビジネス作業(システムの統合)、**4%**は防御です。
  • 理論ではなく現実: 计算机によって生成された(合成された)他のデータセットとは異なり、このデータは本物です。人々が AI に今すぐ機能してほしかったため、実際のパスワード、サーバー名、秘密鍵をチャットに貼り付けていることが含まれています。
  • 「漏洩」の現実: 論文は、驚くべきかつ少し恐ろしい事実を指摘しています。AI が非常に役立つため、専門家は作業を迅速化するために、ライブの秘密(パスワードや秘密鍵など)をチャットに貼り付けることがよくあります。彼らはデータが記録されていることを知っていますが、速度と利便性がリスクを上回る価値があると判断しています。これにより、世界で最も機密性の高い秘密の巨大な集積が、数社の AI 企業の中に生まれています。

4. これが重要な理由(より良い AI への「レシピ」)

著者たちは、このデータセットが次世代のサイバーセキュリティ AI を訓練するために必要な「秘密の調味料」であると述べています。

  • 現状: 現在の AI 訓練のほとんどは、クリーンで完璧な例を使用しています。
  • CAI データセット: これは、ごちゃごちゃした現実世界の例を使用します。これは、壊れたツールをどう扱うか、エラーからどう回復するか、そして複雑な攻撃や防御を多くのステップにわたってどう連鎖させるかを AI に教えます。
  • 目標: 脆弱性が「何か」を知っているだけでなく、人間専門家のように、実際の環境でそれを「どのように」発見し修正するかを知る AI を構築することです。

5. 大きな警告と解決策

論文は、安全性とプライバシーに関する重要な観察で締めくくられています:

  • リスク: 現在、これらの現実世界の秘密や攻撃戦略は、数社の大手 AI 企業のサーバーに流れ込んでいます。もしそれらの企業のいずれかがハッキングされたり、データが誤用されたりすれば、世界的な混乱を引き起こす可能性があります。
  • 解決策: 秘密を漏らさずに AI の速度と力を維持する唯一の方法は、データを制御できる**自社の建物内(オンプレミス)**で、専門特化型の AI を稼働させることです。
  • 貢献: CAI データセットは、パートナーや顧客がこれらのプライベートなオンサイト AI 専門家を構築するのを支援するために、特にリリースされています。これにより、組織は取引の真の技を知りながら、すべての秘密を自社の壁内で安全に保つ、超スマートなサイバーセキュリティアシスタントを持つことができます。

まとめ

論文はこう述べています:「私たちは、AI 向けの究極のトレーニングマニュアルを作成するために、14 ヶ月間にわたる真のサイバーセキュリティ専門家たちが、ミスも含めて仕事をする様子を記録しました。このデータは、専門家たちがすでに作業を完了させるために、最深部の秘密を AI に信頼して預けていることを証明しています。効率性を保ちながらこれらの秘密を安全に保つためには、公開された AI 巨人に依存するのではなく、この現実世界のデータに基づいて訓練されたプライベートで専門特化型の AI 専門家を構築する必要があります。」

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →