← 最新の論文
💬 NLP

Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are Asked?

本研究は、選択肢の数や具体的な表現を含む質問の形式が、推論タスクにおける大規模言語モデルの性能に大きく影響し、推論段階の正確性と最終的な回答の正しさとの間にしばしば乖離を生じさせることを明らかにしている。

原著者: Seok Hwan Song, Mohna Chakraborty, Qi Li, Wallapak Tavanapong

公開日 2026-04-29
📖 1 分で読めます☕ さくっと読める

原著者: Seok Hwan Song, Mohna Chakraborty, Qi Li, Wallapak Tavanapong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

新しい生徒(AI)が論理パズルを解くのがどれほど得意かをテストしようとしている教師を想像してください。その生徒が本当に数学や論理を理解しているのか、それとも単に正解を当てているだけなのかを見極めたいのです。

この論文は、研究者が同じ論理問題を 5 人の異なる AI 生徒に提示した研究からの成績表のようなものです。ただし、質問の出し方は 3 つの非常に異なる方法で行われました。

  1. 「エッセイ」スタイル(短答式):「ここに問題があります。解いて答えを教えてください。」
  2. 「多肢選択」スタイル:「ここに問題があります。5 つまたは 11 つの選択肢から正しい答えを選んでください。」
  3. 「真偽」スタイル:「ここに問題と特定の答えがあります。この答えは真(True)か偽(False)か。」

研究者は知りたいと考えていました:質問の出し方によって、AI のパフォーマンスは変わるのか?

以下に、主要な要点を簡単に説明します。

1. 「当てっこゲーム」効果

最大の驚きは、最終的な正解を得たからといって、AI が正しい作業を行ったとは限らないということです。

  • 比喩: 多肢選択テストを受ける生徒を想像してください。その生徒は計算のやり方を知らないかもしれませんが、「C」と当てて正解を得るかもしれません。解答用紙だけを見ると、100 点です。しかし、計算用紙を見ると、意味のわからないことが書かれています。
  • 発見: AI は、推論プロセスが誤っていた場合でも、多肢選択問題で正しい文字を「当てて」いることがよくありました。逆に、AI が完璧な計算を行ったにもかかわらず、選択肢に混乱して最後の瞬間に間違った文字を選んでしまうこともありました。
  • 教訓: 最終的な答えだけをチェックすると、AI は実際よりも賢いと思い込んでしまう可能性があります。

2. 「メニュー」の問題(多肢選択)

研究者が AI に選択肢のリストを与えたとき、選択肢の数や使用された言葉が非常に重要でした。

  • 選択肢が多すぎる場合: 選択肢が 5 つから 11 つに増えると、AI のパフォーマンスはしばしば低下しました。5 種類のアイスクリームを提供されるのと 50 種類を提供されるのとでは、AI は圧倒されてより多く当てっこをするようになったのです。
  • 「その他」オプション: 研究者は「その他(Something else)」または「上記のいずれでもない(None of the above)」という奇妙なオプションを追加しました。
    • 「その他」が正解だった場合、AI は計算を正しく行ったとしても、それを選ぶのに苦労することがよくありました。AI は、たとえその数字が間違っていたとしても、特定の数字を選ぶことを好むように見えました。
    • AI はまた、「好きな席」バイアスを持っているように見えました。それが正しいかどうかに関係なく、最初の選択肢や最後の選択肢をより頻繁に選びました。

3. 「はい/いいえ」の罠(真偽)

「真(True)か偽(False)」という質問をする際、使用された具体的な言葉が結果を変えました。

  • 真 vs 偽: AI は、答えが正しい場合に「真」と言うことには比較的得意でしたが、答えが間違っている場合に「偽」と言うことにはあまり得意ではありませんでした。同意する方向にバイアスがあるように見えました。
  • 言葉遣い: プロンプトを「真か偽か」から「はいかいいえか」に変えると、AI はあるタスクにおいて著しくパフォーマンスを低下させました。これは、「行きたいですか?」と聞かれた人が「はい」と答える一方で、「行きたいというのは本当ですか?」と聞かれると躊躇するのと同じようなものです。AI はこのような小さな言語的な変化に敏感です。

4. 「指示」の混乱

研究者は、「まず問題を解き、その後にそれが真か偽かを判断してください」といった指示を追加することで、AI の助けになろうとしました。

  • 結果: 時にはこれが役立ちましたが、多くの場合、AI を混乱させたり、パフォーマンスを低下させたりしました。AI は指示に集中しすぎて、問題の実際の論理を忘れてしまうことがありました。

まとめ:私たちが学ぶべきこと

この論文は結論として、AI の知性を判断するために最終的なスコアだけを見てはならないとしています。

  • AI に多肢選択問題を問う場合、論理を理解せずに正しい文字を当てて「不正」をしている可能性があります。
  • 真偽問題を問う場合、使用した具体的な言葉が AI を騙して精度を低下させる可能性があります。
  • AI が本当に賢いかどうかを知るためには、最終的に塗りつぶした解答用紙だけでなく、その「計算用紙(推論プロセス)」をチェックする必要があります。

研究者たちは、これらの癖を理解するために新しいテストセット(ベンチマーク)を構築しました。これにより、将来の開発者が AI をテストする際、単に「当てっこ」が上手いかどうかではなく、「思考」が上手いかどうかをテストしていることを保証します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →