Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025)
本論文は、コーディング用LLMの拒否能力を評価するために用いられる13の悪意あるコードプロンプトコーパスの体系的なレビューを提示し、人間の注釈基準、コーパス間の比較可能性、および分類体系の標準化における重要な方法論的ギャップを特定するとともに、将来のデータセット構築のための統一フレームワークを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
巨大で超知能なロボット(大規模言語モデル、または LLM と呼ばれる)に、どうすれば良き市民になれるかを教える世界を想像してみてください。具体的には、**「もし誰かがこれらのロボットにコンピュータウイルスや詐欺の作成を頼んだら、彼らは『いいえ』と言うでしょうか?」**という問いに答えたいのです。
これを検証するために、研究者たちはロボットを欺くための「試験問題」(プロンプトのデータセット)を作成してきました。この論文は、2023 年から 2025 年の間に作成された13 種類の異なる試験問題に対する、膨大な成績表レビューです。著者であるリチャード・ヤングとグレゴリー・ムーディは、これらすべての試験がどのように構成され、どれほど公平であり、実際に何を測定していたかを調査しました。
以下に、彼らの発見をシンプルなアナロジーを用いて解説します。
1. 問題:誰もが異なる定規を使っている
13 人の異なる人の身長を比較しようとしている状況を想像してください。しかし、ここに落とし穴があります。
- 人物 A はインチ単位の定規で測定される。
- 人物 B はセンチメートル単位のメジャーで測定される。
- 人物 C は壁に到達するまでの歩数で測定される。
- 人物 D は全く別の人物によって測定される。
この論文は、AI の安全性テストにおいてもまさに同じことが起きていると主張しています。13 種類の試験問題(AdvBench、CyberSecEval、RedCode など)はそれぞれ異なって構築されました。
- 異なる質問: 直接コードを要求するものもあれば、複雑な物語を通じてコードを要求するものもあります。AI にハッカーのように振る舞うよう求めるものもあれば、ミスをする可能性のある親切なアシスタントのように振る舞うよう求めるものもあります。
- 異なる採点者: 一部の試験は著者自身によって採点されます。他のものは別の AI ボットによって採点されます。さらに他のものは、コードをサンドボックス環境で実行して爆発するかどうかを確認することで採点されます。
- 異なるルール: 一部の試験は「ウイルス」の定義について厳格なルールを持っています。他のものは曖昧です。
結果: 一つの試験からの「拒否率」(AI が「いいえ」と言った頻度)を単純に取って、他の試験と比較することはできません。それは、スプリンターの記録と水泳選手の記録を比較して、スポーツの違いを考慮せずにどちらが「速い」と宣言するようなものです。
2. 3 つの大きな欠落
著者たちは、13 種類の試験問題のいずれも、真面目な科学的研究において期待される 3 つの重要な安全性機能が含まれていないことを発見しました。
- AI を較正する「人間の判定者」の不在: ほとんどの試験は、他の AI ボットを使って回答を採点しています。しかし、この論文は、これらの AI 採点者が実際に正しいかどうかはわからないと指摘しています。それは、ロボットが数学のテストを採点する際、人間の教師がロボットの採点鍵が正しいかどうかを確認しないのと同じです。13 件の論文のいずれも、異なる人間の判定者が同じ回答に同意することを統計的に証明する「フレイスの kappa 値」を持っていませんでした。
- 「施錠された扉」の不在(ゲート付きアクセス): これらの試験には、危険なソフトウェア(マルウェア)の作成方法に関する指示が含まれています。それにもかかわらず、13 件すべてが完全に一般に公開されています。悪意のある者であっても、誰でもダウンロードできます。それは、爆弾の作り方の料理本を出版し、それを公園のベンチに置いて、誰でも拾えるようにしておくようなものです。
- 「回収ポリシー」の不在(削除): もし、これらの試験に本来あるべきではない危険なプロンプトが見つかったり、AI がそれから学習して実際のウイルスを作り始めたりした場合、著者に連絡して削除を求める公式の方法はありません。どの論文も、有害なコンテンツを削除する責任者や具体的な「削除ポリシー」を記載していませんでした。
3. 教室の「空席」
著者たちは、どのような「ひっかけ問題」が存在するかを示すための地図(分類体系)を作成しました。彼らは、研究者たちが同じ少数の席に座り、多くの席を空けたままにしていることを発見しました。
- 混雑した席: ほとんどの試験は、単一の直接的な文でコードを要求します(例:「ウイルスを作成せよ」)。
- 空席: 非常に少数の試験のみが、以下のような複雑なシナリオをテストしています。
- 長い会話(マルチターン)を通じて AI にゆっくりとウイルスを構築させる。
- AI にコンピュータを制御する自律エージェントとして振る舞わせる。
- ソフトウェアだけでなく、スマート冷蔵庫や車のチップなどのハードウェアを攻撃するコードを要求する。
「席」が偏っているため、データは歪んでいます。AI が単純な要求をどのように処理するかについては多くのことがわかっていますが、複雑で多段階の攻撃をどのように処理するかについてはほとんどわかっていません。
4. 提言:教室をどう改善するか
この論文は、将来より良い「試験問題」を構築したいのであれば、新しいチェックリストに従う必要があると提案しています。
- ルールを事前に登録する: 試験を構築する前に、何をテストするかを正確に書き留め、途中でルールを変更しないようにします。
- 人間の判定者パネルを使用する: 1 つの AI だけで採点するのではなく、「拒否」を何とみなすかについて合意するために、多様なグループの人間(または人間と異なる AI の組み合わせ)を使用します。
- 合意スコアを報告する: 判定者同士が実際に合意したことを示す統計値を公表します。
- 標準的な辞書を使用する: 全員が同じカテゴリを数えるように、「悪いこと」(マルウェアの種類)の単一のリストに合意します。
- 扉を施錠する: 試験に危険な指示が含まれている場合、入手を困難にします(研究者への申請を要求するなど)。これにより、悪意のある行為者が簡単にダウンロードできないようにします。
- 守護者を指名する: 試験が害を及ぼした場合にそれを削除する責任を負う特定の人物を指名します。
まとめ
この論文は「システマティック・レビュー」であり、新しい実験を実行したわけではありません。その代わりに、それは 13 冊の異なる「安全性テスト」の本がある部屋に入り、それらすべてを開いて気づいた司書のようでした。**「私たちはすべて壊れた定規で異なるものを測定しており、これらの本の危険な部分を誰でも見つけられるように外に放置している」**と。
著者たちは、コミュニティに対し、これらのテストを孤立して構築するのをやめ、AI が本当に悪いことを拒否しているかどうかを測定するための標準的で安全かつ公平な方法について合意することを呼びかけています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。