← 最新の論文
💬 NLP

Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation

本論文は、大規模言語モデルのプロンプトの変動に対する堅牢性はタスクの種類に大きく依存しており、客観的な質問に答える場合と価値観や信念に関する主観的な問いに答える場合とでは、モデルが示す安定性のレベルが異なることを示している。

原著者: Sadia Kamal, Arefa Patwary, Anthony Marchiafava, Atriya Sen, Sagnik Ray Choudhury

公開日 2026-07-08
📖 1 分で読めます☕ さくっと読める

原著者: Sadia Kamal, Arefa Patwary, Anthony Marchiafava, Atriya Sen, Sagnik Ray Choudhury

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いが少し神経質なロボットが世界をどう考えているのかを知ろうとしていると想像してください。あなたが質問を投げかけると、ロボットは答えを返してきます。あなたは、その答えがそのロボットの「信念」をしっかりと反映しているものだと仮定します。

この論文は、一種の現実的な検証です。研究者たちはこう問いかけました。「問いかけ方(聞き方)によって、結果は変わるのだろうか?」

彼らの結論は、答えは明確に**「イエス」**である、というものでした。実際、質問の仕方によってロボットの回答は完全に変わり得ます。そして、この現象は、数学や科学のような「事実」に関する質問よりも、「意見(政治や価値観など)」に関する質問において、より頻繁に起こります。

以下に、簡単な比喩を用いた彼らの研究結果の解説をまとめます。

1. 2種類の質問

研究者たちは、2種類の異なる「テスト」でロボットをテストしました。

  • 事実テスト(客観的): これは算数のクイズのようなものです。「2 + 2 は?」という問いには、唯一の正解(4)があります。もしロボットが「5」と言えば、それは単に間違いです。
  • 意見テスト(主観的): これは性格診断のようなものです。「夏と冬、どちらが好きですか?」という問いに、唯一の正解はありません。ロボットは自分がどう「感じているか」を伝えるべきものです。

2. 「変幻自在な」プロンプト

研究者たちは、ただ質問を一度投げかけただけではありません。彼らは、まるで手品師がウサギが同じように現れるかを確認するために、トリックをわずかに変えてみるように、全く同じ質問を多くの異なる方法で投げかけました。

  • 言い回しを変える(類義語を使用する)。
  • 形式を変える(太字にしたり、空白を変えたりする)。
  • 回答の順番を入れ替える(「冬」の代わりに「夏」を最初に持ってくる)。
  • さらに、ロボットが混乱するかどうかを見るために、小さなスペルミスさえも加えました。

3. 大きな発見:意見は「ふにゃふにゃ」である

主な結果として、ロボットは事実に関する質問よりも、意見に関する質問に答えるときの方が、**はるかに不安定(不安定)**であることが分かりました。

  • 事実テスト: もし「2 + 2 は?」を10通りの方法で尋ねたとしても、ロボットはほぼ常に「4」と答えました。それはまるで岩のように、動かしがたいものでした。
  • 意見テスト: もし「夏は好きですか?」と10通りの方法で尋ねた場合、あるバージョンでは「はい」と答え、別のバージョンでは「いいえ」と答えるかもしれません。それはまるでゼリーのように、突っついた方法によって形を変え、ゆらゆらと揺れ動きました。

4. 「席替え」効果

研究者たちは、ロボットが最も理性を失う特定のトリックを見つけました。それは、**「回答の順番を変えること」**です。

選択肢が A、B、C、D と並んでいる多肢選択式の質問を想像してください。

  • もしそれらを D、C、B、A の順に入れ替えると、たとえ言葉が同じであっても、ロボットはしばしば異なる文字を選択します。
  • これは、意見に関する質問においてはるかに多く起こりました。まるでロボットが、「あ、今は上のほうに答えがあるんだ? じゃあ、これが私が選ぶべきものなんだろう!」と考えているかのようです。内容について考えているのではなく、単に選ばされているのです。

5. なぜこれが重要なのか

この論文は、ロボットの回答一つを、そのロボットの「信念」の証拠として信頼してはならないと警告しています。

  • 比喩: あなたが友人に「ピザは好き?」と聞いたとします。彼らは「はい」と答えます。あなたはそれを、彼についての事実として書き留めます。しかしその後、同じ質問を投げかけますが、今度はメニューの最後に「ピザ」を記載したところ、彼は「いいえ」と答えました。
  • 結論: たった一度の会話に基づいて、その友人が「ピザが好き」あるいは「嫌い」であると言うことはできません。彼らがどう答えるかを見るためには、さまざまな方法で質問しなければなりません。

まとめ

この論文は、AIが政治や価値観について何を「信じているか」を知りたいのであれば、単に一つの質問をして、その答えを額面通りに受け取ってはならないと結論づけています。私たちは、多くの異なるバージョンの質問でテストしなければなりません。もし、言葉の配置を変えただけでロボットが意見を変えるのであれば、私たちはそのロボットが何を信じているのかを本当には分かっていないことになります。私たちが知っているのは、単に「問いかけ方に対してどう反応するか」だけなのです。

要するに: ロボットの「パーソナリティ」は脆弱です。それは、質問が感情に関するものか事実に関するものかによって、質問の形に応じて変化してしまうのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →