← 最新の論文
💬 NLP

Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy

本論文は、大規模言語モデルが意味を保持した言い換えに直面した際、その回答に著しい不安定性を示すことが多いことを明らかにし、標準的な精度指標が信頼性の問題を隠蔽する可能性があること、および自己言い換え戦略が潜在的な知識を効果的に回収して性能を向上させ得ることを示している。

原著者: Kazem Faghih, Yize Cheng, Shoumik Saha, Mobina Pournemat, Armin Gerami, Soheil Feizi

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Kazem Faghih, Yize Cheng, Shoumik Saha, Mobina Pournemat, Armin Gerami, Soheil Feizi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

完璧なロボットという幻想

あなたは、図書館にあるほぼすべての本を読み終えた、非常に賢いロボットの友人と話していると想像してください。あなたが単純な質問をすると、そのロボットは素晴らしく正しい答えを返してくれます。あなたは自信を感じるでしょう?でも、もし全く同じ質問を、言葉を少しだけ変えてもう一度投げかけたらどうなるでしょうか?それでも同じ答えを返してくれるでしょうか?これが、メリーランド大学のコンピュータ科学者たちによる新しい研究の背後にある大きな問いです。彼らは、チャットボットなどのツールの背後にある超スマートなAIの脳である「大規模言語モデル(LLM)」に注目しています。これらのモデルはテストにおいて正確であることで有名ですが、この研究はトリッキーな問いを投げかけています。彼らは本当に信頼できるのか、それとも単に質問の言い回しに基づいて推測するのが上手いだけなのか?これは、練習問題の正確な言い回しを暗記している学生のようなものです。もし質問が少し変わったら、その学生はまだ答えを知っているでしょうか、それとも混乱してしまうでしょうか?研究者たちは、これらのAIモデルが真に世界を理解しているのか、それとも単に「言葉のマッチング」というゲームをしているだけなのかを知りたいと考えました。

同じ質問、間違った答え

研究者たちは、小規模なオープンソースのものから、大手テック企業が使用する巨大で強力なモデルまで、13種類の異なるAIモデルを使ってゲームを行うことにしました。彼らは実世界の事実に関する質問(例:「アンデルセンは1864年に何回のチェスの試合に敗れたか?」)や数学の問題を用意し、その後、全く同じ質問を数十通りの異なる方法で書き換えてモデルに投げかけました。彼らは、新しい質問が元の質問と全く同じ意味を持つようにしました。例えば、「調子はどう?」と「最近どう?」や「元気?」と言う違いのようなものです。

ここで、彼らが見つけた驚くべき展開があります。AIモデルはしばしば一貫性を欠いていました。 質問の意味は同じであるにもかかわらず、モデルは最初の質問では正解し、言い換えられた質問では間違えることがあったのです。実際、多くの質問において、モデルは言い回しによって正解と不正解の間で揺れ動いていました。研究によると、モデルが同じ質問に対して異なる回答をする「ミスマッチ率」は、**23%**を超えることもありました。これは、もし100回、異なる方法で同じ質問を投げかけたとしても、モデルは(正解を知っているはずなのに)約4回に1回は異なる(そして間違った)答えを出す可能性があることを意味します!

「隠れた知識」のギャップ

この物語で最も興味深い部分は、これがAIが実際に何を「知っている」のかについて何を物語っているかという点です。研究者たちは、モデルの中に正しい答えがしばしば「隠されている」ことを発見しました。もし同じ質問を十分に多くの異なる方法で投げかければ、モデルは最終的に少なくとも一度は正解にたどり着きます。これは、知識はそこにあるものの、モデルがそれを引き出す(リトリーバルする)際に信頼性に欠けていることを示唆しています。

これを可視化するために、テストを受けている学生を想像してみてください。

  • 標準的な正確性(Standard Accuracy): 学生が初回に80%正解する。
  • 信頼できる能力(Reliable Capability): どんな聞き方をしても、毎回80%正解する。
  • 潜在的な能力(Latent Capability): 10通りの方法で尋ねれば、少なくとも一度は正解にたどり着く。

研究では、「信頼できる能力」と「潜在的な能力」の間に大きな隔たりがあることが分かりました。モデルは答えを知っている(潜在的)のですが、それを一貫して示すこと(信頼できる)に失敗するのです。場合によっては、単に別の言い方で尋ねるだけで、追加で**30%**の質問に正解できることもありましたが、標準的なテストではそれに失敗していました。これは、私たちがリーダーボード(順位表)で見ている標準的な「正確性」のスコアが、多くの不安定さを隠している可能性があることを意味します。モデルは必ずしも愚かなわけではありません。ただ、脆い(フラジャイルな)のです。彼らは深い、揺るぎない理解ではなく、特定の言葉のパターンに依存しています。

「反転」と「修正」

研究者たちはまた、「反転率(flip rates)」と呼ばれるものについても調査しました。これは、モデルが最初の質問には正解したものの、言い換えると間違えてしまう場合、あるいはさらに混乱したことに、最初の質問には間違ったものの、言い換えると正解する場合のことです。この「行ったり来たり」する挙動は、モデルの脳が不安定であることを示しています。それは、持ち方によって北を指したり東を指したりするコンパスのようなものです。

しかし、希望の光もありました。研究者たちは「自己パラフレーズ(Self-Paraphrasing)」と呼ばれる簡単なトリックを試しました。モデルに質問を一つ投げる代わりに、まずモデル自身にその質問を自分の言葉で書き換えさせ、その新しいバージョンに基づいて回答させるのです。これは、学生に「答える前に、頭の中で質問を読み直して」と頼むようなものです。このシンプルなステップは、モデルがその隠された潜在的な知識にアクセスするのを助け、パフォーマンスを向上させることで、モデルがそのギャップを埋める助けとなりました。

これが未来に意味すること

この論文の主な教訓は、標準的な正確性のスコアは誤解を招く可能性があるということです。モデルがテストで高いスコアを出したからといって、それが実世界で真に信頼できるとは限りません。現実の世界では、人々はあらゆる奇妙な方法で質問をします。もしAIがそれに対応できないのであれば、それは実用段階には達していません。この研究は、単に「いくつの質問に正解したか?」を見るのではなく、「どれほど一貫しているか?」を問い始める必要があることを示唆しています。

著者たちは、AIが真に信頼できる存在になるためには、異なる言い回しに対して一貫性を保つ能力についてテストされる必要があると述べています。それまでは、私たちはこれらのロボットがどれほど賢いかを過大評価している可能性があります。彼らは台本を暗記することには長けているかもしれませんが、途中で場所を見失うことなく即興で行う方法を、まだ学ぶ必要があるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →