When are likely answers right? On Sequence Probability and Correctness in LLMs
本論文は、大規模言語モデルにおけるシーケンスの確率と正確性の関係を調査し、高い確率が固定されたデータセット内においてはしばしば正確性を予測するものの、デコーディング手法の変更による精度の向上や、同一のプロンプトに対する正解の識別においては信頼できる指標ではないことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデル(LLM)を、あらゆる本を読み尽くした超想像力豊かなストーリーテラーだと想像してみてください。あなたがこのストーリーテラーにプロンプト(物語の始まり)を与えると、彼らは単に一つの結末を吐き出すのではなく、何千もの異なる可能性のある結末を生み出すことができます。
この論文が投げかけている大きな問いは、**「もし物語の結末が、ストーリーテラーにとって非常に『ありそう(likely)』、あるいは『自然』だと感じられる場合、それは本当に『正しい』答えなのだろうか?」**ということです。
著者たちは、モデルの「確率」(モデルがその文章をどれくらい起こりやすいと考えているか)を、**「自信メーター」**として扱いました。彼らは、この自信メーターのボリュームを上げることが、実際に優れた回答につながるのかどうかを知りたいと考えました。
以下に、その結果をシンプルな比喩を用いて解説します。
1. 「図書館」の比喩(データセット内において)
発見: 特定の種類の質問(数学のテストなど)に対して生成された回答の集まり全体を見ると、モデルが最も「ありそうだ」と考えているものは、通常、正解です。
- メタファー: 本棚を整理している司書を想像してください。もしあなたが「車の修理に最適なガイド本はどれですか?」と尋ねたら、司書は最も自信を持っている本を指し示します。さまざまな質問が集まった中では、この司書はたいてい正しい判断を下します。
- 落とし穴: これは、異なる質問同士を比較している場合にのみ機能します。ある特定の質問に対して、司書が自信を持っているからといって、その司書が正しい本を選べる完璧な存在であることを意味するわけではありません。
2. 「チューニングノブ」の比喩(設定の変更)
発見: 設定を変更して(例えば、ランダム性を抑えるように)モデルを「より自信満々に」させようとしても、必ずしも回答が良くなるとは限りません。実際には、より自信に満ちた「響き」を持つだけで、より悪い回答になることがよくあります。
- メタファー: ラジオを想像してください。音楽をより大きく、クリアに聞こえさせるために「信号強度」のノブを回すことができます。しかし、回しすぎると、たとえ正しい曲ではなくても、非常に大きくクリアに聞こえる「ノイズ」が生じるだけかもしれません。
- 現実: この論文では、モデルが「最も起こりやすい」シーケンスを選ぶように設定を調整すると、モデルが自信に満ちたように聞こえることはあっても、モデルが賢くなるわけではないことが分かりました。時には、「最も起こりやすい」経路が実は罠であることもあるのです。
3. 「群衆の投票」の比喩(同じ質問、異なる回答)
発見: モデルに全く同じ質問を32回投げかけたとしても、「最もありそうな」回答が常に正しいとは限りません。モデルは32通りの異なる回答を出す可能性があり、モデルが最も確率が高いと考えているものが間違っていることもあります。
- メタファー: 部屋にいる32人に同じなぞなぞを出す場面を想像してください。「この中で誰が一番賢いですか?」と尋ねます。一番大きな声で手を挙げた人(高い確率)が、必ずしも正解を知っているとは限りません。時には、部屋の意見が割れており、「大きな声」は単なる人気のある推測に過ぎないこともあるのです。
- 例外: この論文では、ある特定の種類のパズル(数学の問題)においては、「最も大きな声」が通常は最も賢いという結果が出ました。しかし、他の種類の質問(指示に従うことや医学的アドバイスなど)では、「大きな声」は静かな回答と同じくらい間違っていることがよくありました。
4. 「自己改善」の罠
発見: 自分の「最善の」回答を選ばせて学習させることでAIを賢くしようとする人がいますが、この論文はそれがリスクが高いと警告しています。
- メタファー: 数学を上達させようとしている学生を想像してください。その学生が、自分が「正しいと思う」答えだけを勉強して進めようとしているとしたら。もしその学生がすでに数学にかなり長けていないのであれば、彼は自分の間違いを強化し続けるだけでしょう。「ああ、この間違った答えはとても馴染みがある感じがする、だから正しいに違いない!」と考えてしまうのです。
- 教訓: 「自信」を利用してAIを向上させることができるのは、AIがそのタスクにおいて「すでに優れている」場合のみです。もしAIが苦戦しているなら、自身の自信を信じることは、自信満々に間違え続けることにつながります。
「経験則」のまとめ
この論文は、これらのモデルを使用するための3つの主要な教訓を与えています。
- 「音量」を信じない: モデルが回答を「極めて高い確率である」と言ったとしても、それが正しいとは限りません。
- 文脈が重要: 「確信を持っていること」と「正しいこと」の関係性は、質問の種類(数学はコードとは異なり、指示とは異なる)によって変化します。
- 過度な最適化をしない: 設定を変更してモデルを「より起こりやすく」させようとすることは、通常、助けにはならず、むしろパフォーマンスを低下させます。
要約すると: モデルの「直感(確率)」は、大きな絵を見る際には有用な手がかりになりますが、単一の具体的な問題を解くためのコンパスとしては極めて不適切です。自信のダイヤルを回して、回答が良くなることを期待することはできません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。