A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts
本論文は、既存の言語モデルの安全性ベンチマークにおける混同問題を解決するため、実行可能なマルウェア要求と有害なセキュリティ知識クエリを厳密に区別する合意ラベル付け分類フレームワークと、検証済みの1,554プロンプトからなる「CODE」バンクを導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
セキュリティガードが悪人を阻止する能力をテストしようとしている状況を想像してください。ガードに渡すリクエストのリストがあります。あるリクエストは、ガードに実弾入りの拳銃を渡して「この人を撃て」と言うようなものです。他のリクエストは、教科書を渡して「銃の仕組みと狙い方を説明せよ」と言うようなものです。
長らく、AI の安全性をテストする研究者たちは、これら 2 種類のリクエストを 1 つの大きな山に混ぜ合わせていました。AI に「ウイルスを作成せよ(実弾入りの拳銃)」と求め、同時に「ウイルスの拡散方法を説明せよ(教科書)」と求め、その上で AI が「ノー」と答えた回数を単純に数えるだけだったのです。
この論文の著者であるリチャード・J・ヤングとグレゴリー・D・ムーディは、このようなテスト方法は乱雑だと指摘します。AI がウイルスの作成は拒否するものの、教科書的な説明は喜んで行う、あるいはその逆の場合、単一の「ノー」の回数では AI の脳内で何が起きているのかを把握できません。これは、ガードが銃弾を止める能力を測る際に、ガードが「銃弾に関する知識」を止める能力も一緒に数えてしまうようなものです。ガードが武器を止めるのが得意なのか、それとも単に情報を止めるのが得意なのかを区別できません。
核となるアイデア:「武器」と「知識」の分離
これを解決するため、研究者たちは新しいツールを作成しました。「検証済みプロンプトバンク」です。これは、非常に整理され、二重に確認された書棚のようなものです。彼らは 4 つの既存のテストリストから数千の質問を取り出し、2 つの明確な引き出しに分類しました。
- 「武器」引き出し:これらは、マルウェアやコンピュータ上で実行可能なスクリプトなど、実際に危険なものを「構築」することを AI に求めるプロンプトです。これらは「実行可能な武器」です。
- 「知識」引き出し:これらは、コードを実際に構築することなく、ウイルスの仕組みやシステムへのハッキング方法を「説明」するなど、危険なものを「記述」することを AI に求めるプロンプトです。
書棚の作り方
彼らは単に紙を分類しただけではありません。分類が正確であることを確信したかったのです。そこで、5 つの異なる AI 判事からなる「陪審員」を設置しました。これらの判事は、5 つの異なるテック企業(Anthropic、OpenAI、Google、Zhipu AI、Alibaba)から選ばれました。
5 人の異なる専門家が単一のリクエストを検討すると想像してください。彼らは全員、「これは武器を求めるリクエストか、それとも単なる情報求めるリクエストか?」と投票しなければなりません。
- 5 人中少なくとも 3 人が同意すれば、それが最終的な答えとなります。
- 彼らは、合意度を評価するために統計ツール(フレスのカッパ係数)を用いて作業を検証しました。その結果は「ほぼ完璧」な一致(1.0 点中 0.876 点)でした。つまり、この分類は極めて信頼性が高いことを意味します。
結果:クリーンで検証済みのリスト
17,000 件以上の元のリクエストを分類し、重複や曖昧なものを除外した後、彼らは「武器」(悪意のあるコード)を要求するもののみを対象とした、クリーンで検証済みの1,554 件のプロンプトのリストにたどり着きました。また、後で比較のために使用する「知識」に関する 388 件のプロンプトのリストも保持しました。
なぜこれが重要なのか
この論文以前、研究者が AI の安全性をテストしようとする場合、自分自身で「武器」と「知識」のどちらに該当するかを推測しながら、ごちゃごちゃとした質問の山を構築する必要がありました。これは、すべての研究がわずかに異なることを意味し、結果を比較することを困難にしていました。
この論文は、標準化され、事前に分類された質問セットを提供します。これにより、研究者は「私たちは AI を、これら特定の 1,554 件の武器リクエストでテストしました」と言うことができ、他の誰もがその意味を正確に理解できるようになります。これにより推測が排除され、異なる AI モデルが危険なリクエストをどのように処理するかを、公平で「りんご同士」の比較が可能になります。
重要な安全に関する注記
著者たちは非常に明確に述べています。彼らは新しいウイルスや危険なコードを一切作成していません。他の学術研究から既存の質問を取り出し、分類しただけです。このツールの目的は、どこで失敗するかを正確に理解することで AI をより安全にし、誰かが攻撃を構築するのを助けることではありません。データは「ゲート付き」システムによって保護されており、実際の質問のテキストにアクセスできるのは、安全性に取り組む認定された研究者のみです。
要約すれば、この論文は AI の安全性を測定するための、より良く、よりクリーンな定規を構築しました。「悪いことを実行する」リクエストと「悪いことについて語る」リクエストを分離することで、それらを正確に測定できるようにしたのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。