← 最新の論文
🤖 AI

When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs

本論文は、難解な科学問題における小規模な指示チューニング済みLLMにおいて、生成された回答間の高い一致が必ずしも正解性と信頼性のある相関関係を持つわけではないため、多数決による自己一貫性が単一サンプル推論と比較して精度を低下させることが多いことを示している。

原著者: Utkarsh Bahuguna

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Utkarsh Bahuguna

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に難しい謎解きに挑戦しているところを想像してみてください。友人に答えを聞いてみましたが、彼らは確信が持てないようです。そこで、あなたは同じ謎を10回繰り返して尋ねました。もし彼が8回同じ答えを返してきたら、あなたは「よし、彼は正しいに違いない!」と思うでしょう。これは、現代のコンピュータの脳と呼ばれる「大規模言語モデル(LLM)」が賢くなろうとする仕組みに似ています。一度だけ推測するのではなく、彼らは問題を解くために何度も「思考」し、異なる思考の連鎖を生成させ、最も頻繁に現れた答えを選択するように指示されることがよくあります。この手法は「自己一貫性(Self-Consistency)」と呼ばれます。これは、群衆に投票を求めるようなもので、「多数決」がほとんどの場合で正しい答えを導き出すという考えに基づいています。

なぜこれが重要なのでしょうか? それは、これらのコンピュータの脳が、生物学から物理学まで、困難な科学的問題を解決するために使われ始めているからです。もし「群衆投票」のトリックがうまくいくのであれば、コンピュータにより長く、より深く考えさせることで、より良い結果を得られるはずです。しかし、もしその群衆が実は間違っていたらどうでしょう? もしコンピュータがある間違った答えに対してあまりにも自信を持ってしまい、何度も問いかけることで、かえってその間違いに深く固執させてしまうとしたら? これが、この論文が投げかける恐ろしい疑問です。研究者たちは、コンピュータに自分の答えに対して投票させたとき、実際に助けになるのか、それとも図らずも状況を悪化させてしまうのかを知りたいと考えました。


投票の逆効果(The Great Voting Backfire)

この研究において、研究者たちは2つの有名な小型コンピュータ脳(Qwen2.5-7BとLlama-3-8Bと呼ばれます)を用いて、「GPQA Diamond」という非常に難しいテストを実施しました。このテストには、生物学、化学、物理学に関する198問の大学院レベルの科学問題が含まれています。これは、大学生が汗を流すようなレベルの内容です。

チームは、これらのモデルに自分の答えに対して「投票」させたときに何が起こるかを調べるために、巧妙に計画された手法を用いました。彼らは各問題に対して最大64回の解答試行を生成させ、その後、最も一般的な答え(多数決)を採用しました。

ここにひねりがあります。多数決が逆効果になったのです。

賢くなるどころか、コンピュータの脳はほとんどの問題において、実際には精度が低下しました。

  • Qwenモデルの場合、投票法によって問題の**56.6%**で精度が低下しました。
  • Llamaモデルの場合、**65.7%**の問題で精度が低下しました。

このように考えてみてください。ある学生が難しい数学のテストを受けているとします。彼はある問題について確信が持てないので、「答えは何だろう?」と自分自身に10回問いかけます。もし彼が頭の中で偶然同じ間違いを8回繰り返してしまったら、「多数決」はその間違った答えを高い自信を持って選ぶように彼に指示してしまいます。問いかける回数が増えるほど、彼はその間違った答えに対して確信を深めてしまいます。論文ではこれを「バックファイア(逆効果)」と呼んでいます。こうした難しい科学問題においては、コンピュータの自信は「嘘つき」であることが判明したのです。

「オラクル(神託)」の夢 vs 現実

研究者たちは次に、実用的な問いを投げかけました。「いつ投票し、いつ一度だけ推測すべきかを判断するための、安価でスマートなフィルターを作れるだろうか?」

彼らは、完璧な「オラクル(正解を知っている魔法のガイド)」を想像しました。もしこのオラクルが各問題を見て、「この問題については64回投票せよ」とか、「あの問題については一度だけ推測せよ」と言えるとしたら、モデルのスコアは14〜17パーセントポイント向上していたはずです。これは大きな飛躍です!

しかし、研究者たちは、この魔法のオラクルの代わりとなる安価なシグナルとして、2つの現実的な「検証器なし(verifier-free)」のシグナルをテストしました。

  1. 合意ゲート(The Agreement Gate):「もし答え同士が十分に一致していれば、投票を信頼せよ」
  2. エントロピー・ゲート(The Entropy Gate):「もしコンピュータが『不確実』に見えるなら(高エントロピー)、投票せず、もし『確信』を持っているように見えるなら(低エントロピー)、投票せよ」

結果はどうだったでしょうか? 両方のゲートが失敗しました。
どちらの手法も、魔法のオラクルの持つポテンシャルには到底及びませんでした。実際、これらのゲートを使用しても、盲目的に64回投票した場合と比較して、スコアは全く改善しませんでした。「合意ゲート」はあまりにも役に立たず、差はほとんどありませんでした(0.002未満)。「エントロピー・ゲート」もまた、行き止まりでした。

なぜ起こったのか?

論文では、問題は単純ですが、もどかしいものであると説明しています。それは、**「自信(Confidence)は正しさ(Correctness)と一致しない」**ということです。

これらの難しい科学問題において、コンピュータモデルはしばしば間違った答えに固執してしまいます。64個の回答を生成するとき、彼らは同じ間違った答えを50回生成してしまうことがあります。「多数決」はその50票の誤答を見て、「これは正しいに違いない!」と判断します。コンピュータは自信満々に間違っているのです。

研究者たちがデータを調べたところ、Llamaモデルについて面白いことが分かりました。答えが最も一致していた問題は、実は最も精度が低い問題でした。コンピュータが自分自身と一致すればするほど、それは間違っている可能性が高くなります。それは、グループの友人たちが皆でひどい映画のプロットについて同意しているようなものです。彼らが一致すればするほど、そのプロットがデタラメであることを確信できるのです。

これが意味すること

論文は、これらの特定の難しい科学問題については、「より多く考えること」や「投票すること」が必ずしも役立つとは限らない、と結論づけています。

  • 悪いニュース: もしコンピュータ自身の合意に基づいて、それが正しいかどうかを判断しようとするなら、騙される可能性があります。「多数派」はしばしば間違っています。
  • 良いニュース: 私たちはなぜ失敗するのか(自信が正しさを追跡していないため)を正確に知っており、合意や不確実性をチェックするといった単純なトリックでは解決できないことも分かっています。
  • 未解決の問い: 研究者たちは、最新の「推論ネイティブ(reasoning-native)」モデル(論理のために特別に設計された超スマートなモデル)についてはテストを行っていません。彼らはそれを未来の謎として残しています。おそらく、これらの新しいモデルなら、逆効果にならないかもしれません。まだ誰にも分からないのです。

要約すると、最も難しい科学問題において、コンピュータに自分の答えに対して投票させることは、しばしば間違いを確定させてしまうだけです。真の恩恵を得るためには、単に「より大きな声での投票」ではなく、もっとスマートな「検証方法」が必要なのかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →