The Computational Basis of Confidence in Large Language Models
本論文は、統計的決定信頼性(SDC)の規範的枠組みを適用することで、マルチモーダル言語モデルにおける回答ロジットが、ヒューリスティックな選好スコアではなく、潜在的な決定変数の単調な読み出しとして機能していることを示し、それによって生物学的知能と人工知能を統一する信頼性の計算論的説明を提供する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術的要約:大規模言語モデルにおける自信の計算論的基盤
問題提起
信頼できる自信(モデル自身の回答が正しい確率)は、大規模言語モデル(LLM)を信頼性高くデプロイするための前提条件である。既存の文献では、予測精度(正解との相関)や較正(報告された確率と経験的な頻度の合致)に基づき、自信のシグナルを広範に評価してきたが、根本的な問いが未解決のまま残されている。それは、**「自信のシグナル自体が計算論的に何を表しているのか?」**という点である。
回答トークンの確率や言語による報告といった現在のシグナルは、多くの場合、正解性の経験的な予測因子として扱われている。しかし、これらのシグナルが単なるヒューリスティックな選好スコア(証拠を非ベイズ的な方法で組み合わせたもの)なのか、あるいは**潜在的な決定変数(latent decision variable)**の単調な読み出し(readout)として機能しているのかは不明である。計算神経科学において、潜在的な決定変数とは、規範的なプロセスモデルの下で、統計的決定自信(SDC:statistical decision confidence、すなわち正解の事後確率を計算するのに十分なもの)を算出するための、ノイズを含む内部表現である。自信のシジュグナルがヒューリスティックなスコアなのか、それとも規範的な読み出しなのかを区別することは、モデルの自信の内部メカニズムを理解する上で極めて重要である。
方法論
著者らは、計算神経科学における規範的モデルである**統計的決定自信(SDC)**のフレームワークを用い、回答ロジットが潜在的な決定変数の読み出しとして振る舞うかどうかを検証する。本研究では、**回答ロジットの差(LD = )**を候補となる読み出しとして焦点を当てる。
これを検証するために、著者らは3つの異なる決定レジームにわたって、SDCフレームワークが予測する4つの定性的シグネチャを評価する。
- 心理物理関数(Psychometric Function): 選択確率は、符号付きの刺激強度に対して単調に増加しなければならない。
- 符号付き証拠のエンコーディング(Signed Evidence Encoding): 符号付きのLDは、符号付きの刺激強度に対して単調に変化しなければならない。
- 試行ごとの自信(固定強度予測): 固定された客観的な刺激強度において、LDの大きさ($|LD|$)が正解率を予測しなければならない。これは、LDの試行ごとの変動が、単なる客観的な難易度の変化ではなく、内部ノイズを反映しているかどうかをテストするものである。
- 折り返しX型パターン(Folded-X Pattern): 刺激強度が増加するにつれ、$|LD|$は正解試行では増加し、誤答試行では減少する。この幾何学的なシグネチャは、高強度の誤答が、ノイズによって潜在的な決定変数が決定境界をわずかに越えてしまった場合にのみ発生するという性質から生じる。
実験設定:
- モデル: 3つのマルチモーダル非推論モデル(Qwen2.5-VL 7B, Gemma 3 12B, Gemma 4 12B)および1つのマルチモーダル推論モデル(Gemini Flash 3)。
- タスク:
- 知覚的識別: 刺激強度を実験的に制御可能な、3つの合成視覚タスク(コントラスト、物体サイズ、形状のカテゴリ化)。決定論的なモデルにおいて試行ごとの変動を誘発するため、著者らはタスクに無関係な特徴量(空間的なジッター、ドットの実現形式など)をランダム化することで、各強度レベルにおいて複数の刺激例を作成した。
- 記憶に基づく決定: 世界知識の想起を必要とする、都市人口比較タスク。
- 複雑な視覚推論: パラメトリックなガウスぼかしを伴うCLEVRタスク(個数の等価性、物体の存在性)。
- 行動的検証: 内部的な自信(LDから導出)が正解確率60%を下回る場合に回答を控えるよう指示された、棄権(abstention)タスクを実施した。
主な結果
1. 知覚タスクにおける証拠のエンコーディングと潜在変数シグネチャ
3つの知覚タスク全体を通じて、モデルは以下の4つのSDCシグネチャをすべて満たした。
- 心理物理および符号付きエンコーディング: 選択確率と符号付きLDは、刺激強度に対して単調に変化した。これにより、モデルがタスクに関連する証拠をエンコードしていることが確認された。
- 固定強度予測: 客観的な刺激の難易度が一定である場合でも、より大きな $|LD||LD|$ を刺激強度モデルに加えることで、AUROC が 0.864 から 0.907 に向上した)。これは、LDが客観的な難易度を超えて、試行ごとの決定証拠を保持していることを示している。
- 折り返しX型パターン: 正解度と刺激強度の相互作用は、特徴的な折り返しX型の幾何学構造を生み出した。正解試行では $|LD||LD|$ は減少した。これは Qwen、Gemma 3、Gemma 4 で観察された。唯一の軽微な例外として、Gemma 3 のコントラストタスクにおいて、誤答のブランチが反転せず平坦であったが、強度内での予測能は依然として強力であった。
2. 記憶および推論への汎化
- 記憶に基づく決定: 都市人口タスクにおいて、想起される知識のノイズが高いため、心理物理関数は緩やかであった。しかし、潜在的な決定変数のシグネチャは維持された。すなわち、$|LD|$ は固定された人口証拠ビン内で正解率を予測し、折り返しX型パターンも存在した(Gemma 3 ではより鮮明であった)。これは、客観的な刺激軸がモデルの内部証拠のノイズの多い代理指標である場合でも、LDが潜在的な決定証拠の読み出しとして機能することを示している。
- 複雑な視覚推論(CLEVR): ガウスぼかしを伴う CLEVR タスクにおいて、最初の2つのシグネチャ(符号付き証拠軸に依存するもの)は、ぼかしが特定の回答を支持するのではなく情報を除去するため、直接適用できなかった。しかし、3番目のシグネチャは保持された。すなわち、$|LD|$ はぼかしの強度やシーンの制御を超えて正解率を予測した。ただし、折り返しX型パターンは観察されず、誤答のブッチは負ではなく平坦または正であった。著者らは、複雑な推論のための既知の規範的プロセスモデルが存在しないため、特定の幾何学的予測を導出できなかったことに起因すると考えている。
3. 行動的帰結
棄権タスクにおいて、モデルはLDシグナルに基づいて低自信の回答を選択的に控えた。
- モデルは全試行の87.7%で棄権し、高自信の応答にのみコミットした。
- コミットした試行における正解率は、ベースラインの 92.2% から 99.95% へと上昇した。
- 棄権ポリシーは、客観的な刺激強度よりも内部のLDシグナルをより正確に追跡しており、その結果得られた挙動は、$|LD|$ に対する理想的な閾値処理に酷似していた。
意義と主張
本論文は、自信のシグナルが正解率を予測するという経験的な観察を超え、マルチモーダルLLMにおける自信の計算論的説明を提供している。
- 潜在的な決定変数の読み出し: 主要な主張は、単純な知覚および記憶タスクのように規範的なプロセスモデルを指定できる設定において、回答ロジットは単なるヒューリスティックな選好スコアではなく、潜在的な決定変数の単調な読み出しとして振る舞うということである。この変数は、原理的には、現在の選択が正しい事後確率を計算するために十分である。
- 統一されたフレームワーク: 本研究は、生物学的知能と人工的知能の両方における自信を研究するための統一的な計算論的フレームワークとして、SDCを確立した。これは、回答ロジットが規範的な読み出しとして機能する条件と、ヒューリスティックなスコアとして機能する条件を明確に区別するものである。
- 限界と境界: 著者らは、複雑な推論タスク(CLEVR)において折り返しX型パターンが見られなかったことは、必ずしもSDCの失敗を意味するものではないと謙虚に述べている。むしろ、それは現在のフレームワークの境界を浮き彫りにしている。つまり、複雑な推論のための明示的な規範的プロセスモデルがない限り、特定の幾何学的シグネチャを導出しテストすることはできない。結果は、複雑なタスクにおいてもLDが正解率に関する試行ごとの情報を持っていることを示唆しているが、それが規範的な潜在変数であるかどうかの地位は、適切なプロセスモデルが開発されるまで未解決のままである。
要約すると、本研究は、単純な決定や記憶に基づく決定において、LLMにおける自信のシグナルが生物学的システムに見られる潜在的な決定変数と構造的に同型であることを示しており、モデルの自信を解釈するための厳密な基礎を提供している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。