← 最新の論文
💬 NLP

Accuracy and Order Sensitivity Diverge Under Label-Free Strategies

本論文は、多肢選択解答において大規模言語モデルが選択肢のラベルを見ることを防ぐことは、位置バイアスを排除することには成功するものの、精度の向上には至らず、むしろ性能を低下させることが多いことを示しており、主要なボトルネックはマッチングのメカニズムではなく、選択肢の提示を控えることにあることを明らかにしている。

原著者: Karl Hanna, Chen Feng

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Karl Hanna, Chen Feng

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは教室で多肢選択式のテストを受けているところだと想像してください。答えは分かっているのですが、先生が選択肢の順番をページ上でシャッフルしてしまいました。突然、あなたは間違った記号を選んでしまいます。それは知識を忘れたからではなく、新しい配置に脳が混乱してしまったせいです。これが、大規模言語モデル(LLM)——人間のようにチャットしたり文章を書いたりできる、非常に賢いコンピュータプログラム——の奇妙な世界です。科学者たちは、これらのモデルがどれだけ「知っている」かをテストするために多肢選択式の質問を使用しますが、あるグリッチ(不具合)を発見しました。モデルは、答えがページ上のどこに置かれているかに敏感すぎる、神経質な学生のように振る舞うことがよくあるのです。もし選択肢がA、B、C、Dの順に並んでいれば、モデルは正解するかもしれません。しかし、それらをB、A、D、Cへとシャッフルすると、正解できなくなることがあります。このことは、テストのスコアが信頼できないことを意味します。なぜなら、モデルが本当に賢いのか、それとも単に文字のパターンを推測するのが得意なだけなのかを判別できないからです。研究者たちは、この問題を解決し、AIモデルが本当に何を言っているのかを信頼できるようにしたいと考えています。

この論文の中で、クイーンズ大学ベルファストの2人の科学者、カール・ハンナとチェン・フェンは、この「シャッフル問題」を解決するための巧妙なアイデアをテストすることに決めました。彼らはこう考えました。「もし、モデルに選択肢を一切見せない状態で、まず普通の英語で答えを書かせたらどうだろうか?」次に、ステップ2として、モデル自身の書いた答えを正しい記号に一致させるよう求めるのです。これは、学生にメモ用紙に答えを書かせ、その後にテスト用紙を渡して正しい箇所に丸をつけさせるようなものです。思考段階で選択肢を隠すことで、モデルがその順番に影響を受けられなくなることを期待したのです。彼らはまた、モデルに各選択肢を一つずつ独立して見せるという、もう一つの方法も試しました。これは、レシピを決める前に単一の材料を試食するように、順番によって生じるバイアスを取り除くことを目的としたものです。

しかし、結果は少し期待外れでした。研究者たちは、2つの主要な問題セット(MMLUとARC-Challenge)にわたる6つの異なるAIモデルに対してこれらの手法をテストしました。その結果、彼らの「ラベルフリー」戦略のどちらも、モデルを確実に賢くすることはできないことが分かりました。実際、「先に書いて、後で一致させる」という手法は、ほとんどのケースにおいて、モデルが正解を得る能力をむしろ低下させてしまいました。隠してしまうこと自体が問題だったのです。選択肢が見えないと、モデルは自分の答えをどのように表現すべきかを判断できず、多くの混乱とエラーを招いてしまいました。標準的なテストと同等の成果を上げた唯一のバージョンは、モデルが思考中に依然として選択肢を見ることができたものでした。

さらに驚くべきことに、科学者たちは、モデルの答えの順番に対する敏感さを下げたとしても、それが自動的に正確性を高めるわけではないことを発見しました。例えば、あるモデルはシャッフルされた文字による混乱は大幅に減りましたが、テストのスコア自体は依然として低下しました。これは、文字の順番に基づいて推測することはなくなったものの、依然として教材の内容を十分に理解できていない学生のようなものです。論文は、単に「位置バイアス」(答えがどこに配置されているかによる混乱)を取り除くことが、必ずしもスコアの向上を保証するわけではないと結論付けています。実際、答えをシャッフルして多数決を取る伝統的な手法(巡回置換と呼ばれるもの)は、これらの洗練された新しいトリックよりも優れた結果を示しました。主な教訓は、バイアスを修正することは可能だが、それが必ずしもモデルを賢くすることを意味するわけではなく、テストのデザインを巧妙にしすぎると、モデルが回答する能力そのものを壊してしまうこともある、ということです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →