← 最新の論文
💻 computer science

LLM-Safety Evaluations Lack Robustness

本論文は、現在の LLM 安全性研究が評価パイプライン全体にわたる顕著なノイズと不一致によって阻害されていると主張し、将来の攻撃および防御評価の堅牢性、公平性、および比較可能性を向上させるための体系的なガイドラインを提案する。

原著者: Tim Beyer, Sophie Xhonneux, Simon Geisler, Gauthier Gidel, Leo Schwinn, Stephan Günnemann

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Tim Beyer, Sophie Xhonneux, Simon Geisler, Gauthier Gidel, Leo Schwinn, Stephan Günnemann

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

2 人の新しい警備員のうち、どちらが侵入者を阻止するのが上手かを判断しようとしていると想像してください。警備員に「ひっかけ問題」を次々と投げかけ、うっかり悪い人物を中に入れてしまうかどうかを確認するテストを設定します。

この論文は、大規模言語モデル(LLM)の安全性を評価する現在の手法が、まさにそのような警備員に対して行われる、壊れており、一貫性がなく、設計も拙劣なテストに似ていると主張しています。テスト自体に欠陥があるため、どちらの警備員が優れているかを真に判断できず、AI をより安全にするための進歩が停滞してしまっています。

以下に、この論文の主要なポイントを簡単な比喩を用いて解説します。

1. 質問が小さく、反復的すぎる(データセット)

警備員の泥棒を見分ける能力をテストすると想像してください。1,000 種類の異なる泥棒を見せる代わりに、50 枚の写真しか見せず、その 40 枚は全く同じように見えるとします。

  • 問題点: 論文によると、現在の安全性テストは非常に小さな「悪意のあるプロンプト」のリスト(多くは 100〜500 件)を使用しています。リストが小さすぎるため、結果には「ノイズ」(偶然の運)が満ちています。同じ警備員をわずかに異なる 50 枚の写真のリストでテストすると、スコアが激しく変動する可能性があり、彼らが実際に安全かどうかを知ることは不可能になります。
  • 「部分抽出」の問題: 研究者が巨大な質問リストから、ごくわずかなランダムなサンプルだけを選んでテストすることがあります。これは、100 問の試験問題のうち 3 問だけで生徒を評価する教師のようなものです。全員が異なる小さなバージョンのテストを受けることになるため、異なる生徒を公平に比較することが難しくなります。
  • 「英語のみ」の盲点: ほとんどのテストは英語のみで行われます。しかし、警備員が英語しか話せない場合、スペイン語のテストでは失敗するかもしれません。論文は、安全性に関する知識は言語によって変化することが多いと指摘しており、英語のみでテストすることは、誤った安心感を与えます。

2. ゲームのルールが混乱している(アルゴリズム)

2 人の警備員がテストされていると想像してください。一方は懐中電灯の使用が許可されている一方、もう一方は暗闇で作業を強いられています。あるいは、一方の警備員は速く進むストップウォッチで測定され、もう一方は遅く進むストップウォッチで測定されるとします。

  • 隠れた設定: 論文は、テストの実行方法における小さく目に見えない詳細が、結果を劇的に変化させると指摘しています。例えば、コンピュータが単語間の「スペース」を処理する方法や、どのような「チャットテンプレート」が使用されるかによって、警備員の成功率が 14% 以上変化することがあります。
  • 「ターゲット」の罠: 多くの攻撃は、AI に「もちろん、やり方はこうです…」という特定のフレーズを言わせることで、AI が破綻したことを証明しようとします。しかし、AI が「もちろん!」と言うように訓練されている場合、攻撃は失敗します。それは AI が安全だからではなく、攻撃者が間違った「鍵」を使っていたからです。これにより、AI は実際よりも安全に見えるようになります。
  • 不公平な比較: 一部の研究者は、無制限のコンピュータパワーを使って攻撃手法をテストする一方、他の研究者は非常に限られたリソースでテストします。これらを比較することは、スタート地点から有利な位置にいるスプリンターと、プロの選手が走るレースを比較するようなものです。

3. 審査員が偏っており、一貫性がない(評価)

警備員がひっかけ問題に答えた後、「審査員」が「失敗したか?」を決定する必要があります。

  • 分断された陪審員: AI 安全性のための単一の「最高裁判所」はありません。ある研究者は一つの AI を使って回答を評価し、他の研究者は別の AI を使い、さらに人間を使う人もいます。これらの「審査員」はしばしば互いに意見が一致しません。ある審査員は回答を安全だと判断する一方、別の審査員は同じ回答であっても危険だと判断することがあります。
  • 「貪欲」な誤り: ほとんどのテストは、AI に最も確率の高い単一の回答を強要します(最初に思い浮かんだことだけを常に選ぶロボットのようなもの)。しかし、現実世界では、AI は人のように、気分や質問の回数によって異なることを言うかもしれません。「最も確率の高い」回答のみをテストすることで、AI が「考え方が異なる」場合にうっかり危険なことを言う機会を見逃してしまいます。
  • 「過剰拒絶」の盲点: 安全な警備員は、悪い人物を止めるだけでなく、良い人物も止めないはずです。疑わしいという理由で無害な人物を入れないように拒絶する場合、それは「過剰拒絶」と呼ばれる問題です。論文は、ほとんどのテストがこの点を無視していると述べています。彼らは警備員が悪人を止めるかどうかだけをチェックし、良い人に対して不機嫌になりすぎているかどうかはチェックしていません。

「対立する見解」(なぜ現状のようになっているのか)

論文はまた、反対側の意見にも耳を傾けています。一部の研究者は以下のように主張しています。

  • 小さなテストは安価: 大規模なテストは多額の費用と時間を要します。小さなテストであれば、研究者は新しいアイデアを素早く試すことができます。
  • 完璧は不可能: 言語は厄介です。人間の会話のあらゆるニュアンスを理解する完璧な「審査員」を我々は決して持てません。我々ができるのは、最も優れたツールを改善し続けることです。
  • 進歩は起こる: 混乱したテストであっても、この分野は前進し続けています。スコアボードが完璧でなくても、新しいアイデアは発見されています。

解決策:より良いルールブック

著者たちはテストを中止すべきだと言っているわけではありません。誰もが同じルールに従えるよう、ルールブックを修正すべきだと主張しています。彼らは以下を提案しています。

  1. より大きく、優れた質問リストを使用する: 結果が単なる偶然ではないようにするため。
  2. 設定を標準化する: 誰もが同じ「懐中電灯」と「ストップウォッチ」を使用するようにするため。
  3. 複数の審査員を使用し、人間が結果を二重チェックする: 偏見を捕捉するため。
  4. 両側をテストする: AI が悪い人物を止めるかどうか、そして良い人物を入れているかどうかの両方をチェックする。

要約すると: この論文は、現在、AI の安全性を測定しようとしている際、長さが絶えず変化する定規を使っているに過ぎないと主張しています。定規を修正するまで、我々は実際に進歩しているかどうか確信を持つことはできません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →