Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers
本論文は、既存の信頼度較正手法は、複数の正解を持つ質問に対しては系統的な過小評価が生じるため、大規模言語モデルにおいては失敗することを特定し、単一回答および複数回答の両方のシナリオにおいて堅牢な較正を実現するための新しいベンチマーク(MACE)と意味的信頼度集約(SCA)手法を提案するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大きな問題:「正しいこと」が「混乱」に見えてしまうとき
あなたがトリビア・クイズを受けている場面を想像してください。
- シナリオA: 問題は「『ハムレット』を書いたのは誰か?」です。正解はたった一つ、シェイクスピアです。あなたが「シェイクスピア」と答えれば、それは正解であり、あなたは非常に自信を持っていると感じます。
- シナリオB: 問題は「赤い果物を挙げて」です。正解はたくさんあります:リンゴ、イチゴ、チェリー、ラズベリーなど。
この論文は、現在の大型言語モデル(LLM)がこのシナリオBで混乱してしまうと主張しています。
モデルが複数の正解(リンゴ、イチゴ、チェリーなど)があることを知っているとき、モデルは「票を分散」させてしまう傾向があります。例えば20回試行したとき、「リンゴ」と6回、「イチゴ」と6回、「チェリー」と6回答えるといった具合です。毎回たった一つの答えを選び取れたわけではないため、モデルの内部的な「自信メーター」は低下してしまいます。モデルは、「おっと、どれを選べばいいか分からない。だから自分は確信が持てないのだ」と考えてしまうのです。
皮肉なこと: シナリオBの方が(正解の選択肢が多いため)実際には正解する確率が高いのですが、モデルの自信メーターは低く表示されてしまいます。これは、店に行くためのルートを3つ知っているのに、たった一つのルートに絞り込めないために、自分が道に迷っていると思い込んでしまう人のようなものです。
新しいツール:MACE(「マルチアンサー」テスト)
この問題が存在することを証明するために、研究者たちはMACEと呼ばれる新しいテストを構築しました。MACEを、複数の正解を持つ質問を扱う能力をテストするための、専門的な「ジム」だと考えてください。
- セットアップ: 彼らは、賞、政治的役職、河川など、6つのトピックにわたる12,000の質問を作成しました。
- ひねり: すべてのトピックにおいて、正解がちょうど1つ、2つ、4つ、または6つの質問を作成しました。
- 目的: 正解の数が増えても、モデルの自信スコアが正確に保たれるかどうかを確認することです。
彼らが発見したこと:「ビッグブレイン」のパラドックス
彼らは、4つの異なるファミリーのAIモデル(小型から超大規模まで)に対して、自信を測定する15通りの方法をテストしました。その結果、以下のことが判明しました。
- 精度は上がるが、自信は下がる: 正解の数が増えるにつれて(1つから6つへ)、モデルはより頻繁に正解を出せるようになりました。しかし、推定される自信(コンフィデンス)は大幅に低下しました。
- 大きなモデルほど苦戦する: 最も賢い巨大なモデル(70億パラメータ級のものなど)ほど、最も混乱していました。知識が豊富なため、より多様な正解を生成できてしまうからです。この多様性が、自信チェッカーに対して「優柔不断」に見せてしまい、結果として自信スコアを暴落させてしまいます。
- 「信頼の危機」: 正解が1つのものと6つのものが混在する現実世界の混合問題において、既存の最良な手法さえも失敗しました。モデルがいくつかの異なる正解のバリエーションを提示しただけで、それらを「信頼できない」と判定してしまったのです。
解決策:SCA(「チーム投票」方式)
研究者たちは、**SCA(Semantic Confidence Aggregation:意味的自信集約)**という新しい手法を提案しました。
従来の方法(「トップ・ドッグ」方式):
ほとんどの手法は、モデルが出した中で最も人気のある単一の回答に注目します。もしモデルが20個の回答を出し、そのうち10個が「リンゴ」で、別の10個が「イチゴ」だった場合、従来の方法はこう言います。「一致率は50%しかない。君は自信がないのだ。」
新しい方法(SCA — 「チーム投票」方式):
SCAは、モデルが出したすべての正解の「合計確率」を見ます。
- 回答を意味ごとにグループ化します(例:「リンゴ」系の回答は一つのグループ、「イチゴ」系の回答は別のグループ)。
- すべての正解グループの自信スコアを合算します。
- 結果: たとえモデルが「リンゴ」と「イチゴ」の間で票を割いていたとしても、SCAは「赤い果物」に対する総投票数が100%であることを認識します。これにより、「ああ、モデルは自信を持っている。ただ、有効な選択肢がいくつかあるだけなのだ」と理解できるのです。
まとめ
- 問題点: 現在のAI自信測定ツールは、複数の正解があることを「AIが確信を持てていない」と勘違いしてしまいます。
- 解決策: 新しいSCA手法は、最も人気のある回答だけでなく、すべての有効な回答の自信を合算することで、この問題を解決します。
- 結果: SCAは、正解が多い質問に対してもうまく機能し、かつ正解が1つしかない質問の精度も損ないません。これにより、AIが多くの方法で正解しているときでも、自信を持って振る舞えるようになります。
要するに、この論文は「AIにとって、多くの方法で正解することは、自信がないことと見なされるべきではない。ただ、投票の数え方を改善する必要があるだけだ」ということを教えてくれています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。