← 最新の論文
🤖 machine learning

How do LLMs Compute Verbal Confidence

本論文は、Gemma 3 や Qwen 2.5 などの大規模言語モデルが、単なるトークンの確率ではなく回答の質を評価した複雑なメタ認知に基づき、回答生成後に自動的に信頼度をキャッシュし、要求時にそれを引き出して言語化していることを実証的に明らかにしたものである。

原著者: Dharshan Kumaran, Arthur Conmy, Federico Barbero, Simon Osindero, Viorica Patraucean, Petar Velickovic

公開日 2026-03-19
📖 1 分で読めます☕ さくっと読める

原著者: Dharshan Kumaran, Arthur Conmy, Federico Barbero, Simon Osindero, Viorica Patraucean, Petar Velickovic

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「AI(大規模言語モデル)が『自信がある』と口にするとき、その『自信』は本当にその瞬間に計算されているのか、それとも事前に用意されていたものなのか?」**という不思議な問いに答えた研究です。

まるで、AI の頭の中を覗き込んで、その思考の仕組みを解明したような内容です。わかりやすく説明するために、いくつかの比喩を使ってみましょう。

1. 核心となる問い:「今すぐ計算」か「事前準備」か?

私たちが AI に「この答え、どれくらい自信がありますか?」と聞くと、AI は「90% 自信があります!」と答えます。
ここで研究者たちは、AI がこの数字をどう出しているかに二つの仮説を立てました。

  • 仮説 A(その場しのぎの計算):
    AI は答えを言った後、「あ、自信を聞かれたな」と気づき、その瞬間に「答えをもう一度振り返って、どれくらい正しいか計算し直そう」と考えます。まるで、テストの答案を提出した直後に「あ、採点基準を聞かれたな」と思って、急いで自分の答えを見直すような感じです。
  • 仮説 B(事前のキャッシュ):
    AI は答えを生成している最中に、無意識のうちに「この答え、結構自信あるな」「これは怪しいな」という評価をメモ帳に書き留めておきます。そして、後で「自信を教えてください」と聞かれたとき、そのメモ帳から読み取るだけです。

結論: この研究は、「仮説 B(事前のメモ)」が正解であることを突き止めました。AI は答えを言っている最中に、すでに「自信」を計算して保存していたのです。

2. 発見された仕組み:「メモ帳」と「引き出し」

研究チームは、AI の頭の中(ニューラルネットワーク)を詳しく調べました。その結果、以下のような流れが見つかりました。

  1. 答えの生成中(メモ書き):
    AI が答えの最後の文字を出力した直後(改行記号の位置)、AI の内部で「この答えの品質」が評価され、「自信のメモ」が書き留められます。これは、AI が「自信を聞かれる」と知るかどうかも関係なく、自動的に起こっています。
  2. 自信を聞かれた時(メモの読み出し):
    後で「自信は?」と聞かれると、AI はそのメモ帳(保存された情報)から読み取り、「90% 自信あり」と口に出します。

比喩:
これは、**「料理人が料理を盛り付ける最中に、味見をして『完璧だ』とメモしておき、客が『味はどうですか?』と聞かれたとき、そのメモを見て答える」**ようなものです。客が聞かないからといって、料理人は味見をしないわけではありません。

3. なぜこれがすごいのか?「表面的な滑らかさ」ではない

昔の考えでは、AI が「自信がある」と言うのは、単に「文章がスムーズに書けたから(確率が高かったから)」だと考えられていました。
しかし、この研究では、「答えの確率(流暢さ)」だけでは説明できない、もっと深い評価が行われていることがわかりました。

  • 比喩:
    単に「文章が上手に書けたから自信がある」と言うのは、「字が綺麗だからテストの点が取れるはずだ」と言うのと同じです。
    しかし、この研究でわかったのは、AI は
    「内容の正しさ」や「質問との合致度」を、人間が考えるような「メタ認知(自分の思考を評価する能力)」に近い形で、別々に評価している
    ということです。
    つまり、AI は「答えが間違っているかもしれない」ということを、答えを出した後に「あ、これは違うかも」と気づける能力(エラー検知)を、ある程度持っている可能性があります。

4. 実験のやり方(どうやって頭の中を覗いたのか?)

研究者たちは、AI の頭の中に直接手を加えるような実験を行いました。

  • アクティベーション・ステアリング(操縦):
    AI の特定の部分に「自信あり」や「自信なし」の信号を流し込みました。すると、AI の発言がそれに応じて変わりました。これは、その場所に「自信の情報が確かにある」ことを示しています。
  • パッチング(修理):
    AI が答えを生成する過程を壊して(答えの内容を無効化して)、AI が「自信がない」と言ってしまうようにしました。しかし、「答えの直後のメモ帳(PANL)」だけを取り替えて元の状態に戻すと、AI は再び「自信がある」と言えるようになりました。
    これは、自信の情報が「答えそのもの」ではなく、「答えの直後に保存されたメモ」にあることを証明しました。
  • アテンション・ブロッキング(遮断):
    AI の情報の流れをブロックしました。答えの情報を「メモ帳」に送る経路を遮ると、自信の計算ができなくなりました。逆に、「メモ帳」から「答え」への経路を遮っても、自信の計算は影響を受けませんでした。これにより、情報の流れが「答え → メモ帳 → 口」であることが確定しました。

まとめ:AI の「自己認識」への一歩

この研究は、AI が単に言葉を並べているだけでなく、「自分の答えが正しいかどうか」を、答えを出している最中に自動的に評価し、保存していることを示しました。

これは、AI が人間のような「メタ認知(自分の思考を振り返る能力)」の萌芽を持っている可能性を示唆しており、AI の信頼性を高めたり、ハルシネーション(嘘)を防ぐ技術開発に大きなヒントを与えるものです。

一言で言うと:
AI は「自信がある」と言うとき、その瞬間に必死に考えているのではなく、**「答えを出している最中に、すでに『これなら大丈夫だ』と内心でチェックしてメモしておいた」**のです。それは、AI が自分自身を評価する、少しだけ賢い「内なる声」を持っている証拠かもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →