← 最新の論文
💻 computer science

How Sensitive Are Safety Benchmarks to Judge Configuration Choices?

本論文は、LLM 評価者の構成、特にプロンプトの文言が、安全性ベンチマークにおける測定ばらつきの主要かつ以前は十分に検討されていなかった要因であることを示しており、有害応答率の大幅な変動とモデルの安全性ランキングの不安定性を引き起こしている。

原著者: Xinran Zhang

公開日 2026-04-28
📖 1 分で読めます☕ さくっと読める

原著者: Xinran Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

教師が学生の論文の山を採点していると想像してください。「悪い」論文を判定するための厳格な評価基準(一連の規則)があるとします。次に、非常に賢いものの、気分によって少し左右されるロボットアシスタントを使って、これらの論文を採点しなければならないと想像してください。

この論文は、驚くべき発見について述べています:ロボットに論文を採点させる際の問いかけ方は、ロボットそのものと同じくらい重要である。

以下に、この研究を簡単な比喩を用いて解説します。

1. 設定:「ロボット採点者」実験

研究者たちは、さまざまな AI モデルがどの程度安全かを確認したいと考えました。そのために、彼らは「HarmBench」と呼ばれる標準的なテストを使用しました。これは、「爆弾の作り方は?」「著作権をどうすれば盗めるか?」といった 400 のトリッキーな質問を含んでいます。

彼らは 6 つの異なる AI モデルにこれらの質問に答えさせました。その後、単一の「判定 AI」(Claude Sonnet の特定バージョン)を用いて回答を読み、**「この回答は有害か、安全か?」**を決定させました。

通常、科学者たちは「判定 AI」とそれに与えられる指示を、固定され変更不可能なツールとして扱います。指示の文言をわずかに変えても、結果は変わらないと想定しています。

**研究者は問いかけました:**もし文言が結果を変えるとしたらどうでしょうか?

2. 実験:12 種類の異なる「スクリプト」

研究者たちは、判定 AI 用の指示(プロンプト)を12 種類の異なるバージョン作成しました。彼らは主に 2 つのことを変更しました。

  • 構造: 判定者に、証拠を確認する探偵のように、一つ一つの細部を順番に見るよう指示したのか、それとも校長が報告書を読むように、回答全体を大きな図として見るよう指示したのか。
  • ペルソナ: 判定者に「あなたは厳格で経験豊富な安全専門家です」と伝えたのか、それとも単に「これを評価してください」と言ったのか。

また、各スタイルに対して、指示のわずかに異なる 3 つのバージョンも作成しました(例:「あなたは安全専門家です」対「あなたは AI 安全の専門家です」)。

3. 衝撃的な結果:判定者の「気分の浮き沈み」

テストを実行したところ、指示の文言がスコアを完全に変えてしまうことがわかりました。

  • 比喩: ロボットにスープの「辛さ」を評価させるよう頼むと想像してください。
    • 「あなたは辛さを嫌うプロのシェフです」と言えば、スープは「マイルド」と評価されるかもしれません。
    • 「あなたは安全について非常に厳しい衛生検査官です」と言えば、全く同じスープが「危険なほど熱い」と評価されるかもしれません。
    • 「シェフ」を「料理の専門家」に書き換えるだけで、スコアは大きく上下する可能性があります。

数値:

  • テスト対象の AI モデルの一つにおいて、「有害」率はプロンプトの文言を変えるだけで13% から 37%に跳ね上がりました。これは24 ポイントの揺らぎです。
  • 主要な指示はそのままに、数語だけを表面レベルで言い換えただけでも、スコアは20 ポイント揺れました。
  • つまり、わずかに異なる指示で同じ安全テストを 2 回実行すれば、AI の安全性について全く異なる結論が得られる可能性があります。

4. 最も影響を受けたのは誰か?(カテゴリ別)

すべての質問タイプが同様に影響を受けたわけではありません。

  • 著作権に関する質問: これらが最も敏感でした。プロンプトによって「有害」率は約 40 ポイント揺れました。テキストをコピーすることが「悪い」のか「許容される」のか、どのように尋ねられるかによって判定者が判断に苦しんでいたようです。
  • ハラスメントに関する質問: これらが最も安定していました。スコアは全く変化しませんでした(0 ポイント)。指示の文言がどうあれ、誰もがハラスメントが悪いことに同意しました。

5. ランキングの混沌

スコアがあまりにも大きく変化したため、AI モデルのランキングも混乱しました。

  • スタートラインの色を変えるたびに勝者が変わるレースを想像してください。
  • 研究者たちは、中堅クラスの AI モデルにおいて、その安全性のランキングが常に前後してひっくり返っていることを発見しました。あるプロンプトではモデル A の方がモデル B より安全とされ、わずかに異なるプロンプトではモデル B の方が安全とされました。
  • 「最悪」と「最高」のモデルは位置を維持しましたが、中堅のモデルは信頼性を持ってランキングすることが不可能でした。

6. 結論

この論文は、現在の安全性ベンチマークは「仕様不足」であると結論付けています。

これは、左手で持つか右手で持つかによって異なる温度を示す体温計のようなものです。研究者たちは体温計が壊れていると言っているのではありませんが、単一の測定値を信頼することはできないと言っています。

彼らは、科学者が AI の安全性を報告する際、特定の 1 組の指示に基づいた 1 つの数値だけを提示すべきではないと主張しています。彼らは、「指示」が単なる退屈な詳細ではなく、実験の大きな一部であることを認識する必要があります。言葉を変えれば、結果も変わるのです。

要約すると: 質問の仕方は、質問そのものと同じくらい重要です。AI が安全かどうかを知りたい場合、1 組の言葉で 1 回だけ質問するだけでは不十分です。答えは、依頼の言い方によって完全に依存します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →