← 最新の論文
📊 statistics

LLMs as Implicit Imputers: Uncertainty Should Scale with Missing Information

本論文は、潜在的な欠損値補完者として機能する大規模言語モデルは欠損情報に応じて不確実性を増大させるべきであると主張し、サンプリングに基づく信頼度は文脈の劣化の増大を反映しない一方で、応答エントロピーは欠損を効果的に追跡し精度をよりよく予測することを明らかにしている。

原著者: Stef van Buuren

公開日 2026-05-14
📖 1 分で読めます☕ さくっと読める

原著者: Stef van Buuren

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが謎を解こうとする探偵だと想像してください。通常、犯人を見つけるのを助ける証拠の完全なファイル(「コンテキスト」)を持っています。しかし、時としてそのファイルが破り捨てられ、手元に残るのは数枚の紙の破片だけになります。

この論文は、シンプルだが決定的な問いを投げかけます:あなたの探偵(AI 言語モデル)が欠落した証拠を扱っているとき、それはどれほど不確実であるべきかを知っていますか?

著者らは、AI は「I'm guessing here because I don't have enough clues(十分な手がかりがないので推測しています)」と認める「統計的探偵」のように振る舞うべきだと主張します。それに対し、彼らは現在の AI が、無謀に推測しながらも 100% 確信していると主張する、過剰に自信過剰な探偵のように振る舞うことが多いことを発見しました。

以下は、彼らの発見を単純なアナロジーを用いて解説したものです:

1. 核となるアイデア:「欠落した手がかり」テスト

研究者たちは、AI を**多重代入法(Multiple Imputer)**のように扱いました。統計学において、データが欠落している場合、専門家は単一の答えを推測するのではなく、答えがどの程度変動しうるかを見るために、多くの可能なシナリオを生成します。

  • テスト: 彼らは質問を取り、AI が質問自体以外に読むものがなくなるまで、背景情報(コンテキスト)をゆっくりと破り捨てました。
  • ルール: 手がかりが消えるにつれて、AI の「不確実性」は上昇すべきです。手がかりがなければ、非常に不確実であるべきです。すべての手がかりがあれば、非常に確信を持っているべきです。

2. 「不確実性」を測定する 2 つの方法

研究者たちは、AI に同じ質問を 10 回連続して尋ねた際、AI がどれほど不確実であったかを測定する 2 つの方法を検討しました:

  • 「大きな声」(自信): これは、AI が毎回同じ答えを出す頻度を測定します。10 回中 10 回「デンバー・ブロンコス」と言えば、非常に自信があるように聞こえます。
  • 「群衆の雑音」(エントロピー): これは、答えがどの程度異なるかを測定します。AI が「デンバー・ブロンコス」を 1 回、「ニューイングランド」を 1 回、「パトリオッツ」を 1 回、「わからない」を 7 回と言えば、多くの「雑音」や多様性があります。これは高いエントロピーです。

3. 大発見:「大きな声」は嘘つき

この研究は、「大きな声」(自信)に重大な問題があることを発見しました:

  • 何が起きたか: AI がゼロのコンテキスト(手がかりなし)を持っていたときでさえ、間違った答えを 10 回連続して同じものを出すことがよくありました。それは、トレーニングで暗記したものを基に完全に推測しているにもかかわらず、信じられないほど自信があるように聞こえました。
  • アナロジー: 教科書を忘れた学生がテストを受ける様子を想像してください。彼らはすべての質問に「C」と推測します。彼らは 100% 一貫性があり(高い自信)、しかし 100% 間違っています。AI はまさにこれをやっていました。

4. 勝者:「群衆の雑音」(エントロピー)

「群衆の雑音」(エントロピー)ははるかに良く振る舞いました:

  • 何が起きたか: 研究者たちがコンテキストを除去するにつれて、AI の答えは散らばり始めました。「デンバー・ブロンコス」を 10 回言う代わりに、「デンバー」、「ブロンコス」、「チーム」、「わからない」などと言い始めました。
  • アナロジー: これは部屋にいる探偵のグループのようなものです。彼らがすべての証拠を持っているとき、彼らは全員同じ容疑者を指し示します。証拠を取り除くと、彼らは異なる方向を指し始めます。彼らが混乱するほど、異なる方向を指すようになります。
  • 結果: 「群衆の雑音」の測定値は、AI の精度が低下するにつれて正確に上昇しました。それは混乱の真の信号でした。

5. 「解像度比率」(手がかりがどの程度役立ったか)

著者らは**解像度比率(Resolution Ratio)**と呼ばれる単純なスコアを作成しました。

  • 電球の調光スイッチだと考えてください。
  • コンテキストなし(オフ): 部屋は暗い(高い不確実性)。
  • 完全なコンテキスト(オン): 部屋は明るい(低い不確実性)。
  • スコア: これは「光」(コンテキスト)が「暗闇」(不確実性)をどの程度消したかを測定します。彼らは、完全なコンテキストを持つことが約 80% の不確実性を解消することを発見しました。これは理にかなっています。

論文の主張のまとめ

  • 問題: 現在の AI モデルはしばしば「不適切な代入者」です。情報が欠落しているとき、彼らは不確実性を抑圧し、単一の、自信に満ちた、しかししばしば間違った答えを与えます。
  • 解決策: どれほど頻繁に同じ答えを繰り返すか(自信)ではなく、AI の答えがどの程度変動するか(エントロピー)を見るべきです。
  • 証拠: コンテキストが除去されると、AI の精度は低下しましたが、その「自信」は高く保たれました(私たちに嘘をついていました)。その「エントロピー」(答えの多様性)は上昇し、それが迷っていることを正しく示しました。
  • 教訓: AI が情報が欠落しているために推測しているかどうかを知りたいなら、どれほど確信があるように聞こえるかを聞いてはいけません。こう聞いてください:「10 回尋ねたら、10 通りの異なる答えをくれますか?」もしそうなら、それは不確実であることを知っています。もし 10 回同じ間違った答えをくれるなら、それは過剰に自信過剰です。

この論文は、標準的な「自信」スコアよりも、エントロピーが AI が盲目で飛んでいるときを私たちに伝えるはるかに優れた「ブラックボックス」ツールであると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →