← 最新の論文
🤖 AI

The Knowing-Saying Gap: When Probes See Errors that Confidence Misses

本論文は、線形プローブは言語モデルにおける破損したコンテキストを正確に検出できる一方で、最終的な回答の正誤を確実に予測したり効果的なリアルタイム介入を導いたりすることには失敗しており、一律のモニタリング手法ではなく、モデルに即した、かつエラータイプを考慮したルーティング戦略が必要であることを明らかにしている。

原著者: Jyotin Goel, Ipshita Bandyopadhyay, Justin Shenk

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Jyotin Goel, Ipshita Bandyopadhyay, Justin Shenk

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、手品師がカードマジックを披露している様子を見ていると想像してください。その手品師は非常に滑らかで、自信に満ち、動きが速いため、あなたは決して違和感を抱きません。しかし、もし手品師の脳の奥底で、小さなアラームが「待て!今、違うカードとすり替えてしまった!」と叫んでいたとしたらどうでしょう?人工知能、特にコードを書いたり、旅行の計画を立てたり、数学の問題を解いたりする超スマートなチャットボットである大規模言語モデル(LLM)の世界では、まさにこれが起こっています。これらのモデルは手品師のようなものです。たとえひどい間違いを犯していても、圧倒的な自信を持って話し続けることができるのです。

科学者たちは長い間、モデルが混乱したり間違えたりしたとき、「言葉に詰まる」か、「これについては自信がありません」と言うようになることを期待してきました。この考え方は「言語化された自信(verbalized confidence)」と呼ばれます。これは、手品師に「本当にそのカードで合っていますか?」と問いかけ、彼が自分の間違いを認めることを期待するようなものです。しかし、別の確認方法もあります。モデルの内部的な「脳波」(コンピュータ内の数学的な信号)を見て、たとえ口に出さなくても、モデル自身がミスをしているかどうかを確認する方法です。この論文は、恐ろしくも魅力的なギャップ、すなわちモデルがデジタル脳の中で「知っている」ことと、外に向かって「言っている」ことの差を調査しています。


沈黙のアラームと自信満々な嘘

研究者たちは、これをテストするためのデジタルな遊び場を用意しました。彼らは、連鎖反応のようにステップ・バイ・ステップでパズルを解く必要がある1,400の数学問題を作成しました。例えば、「リンゴを5個持っていて、さらに3個買った。その後、半分を失った……」といった具合です。仕掛けは、連鎖の最初のステップに、密かに間違いを仕込んでおくことでした。彼らは以下の2点を知りたかったのです。

  1. アラーム: 特殊な検出器(「線形プローブ」と呼ばれます)は、モデルの内部的な脳活動を見るだけで、最初のステップが間違っていることを察知できるか?
  2. 予測: その同じ検出器は、最終的な答えが間違っていることを予測できるか?

彼らは、Llama-3.1-8BやQwen3-4Bといった、今日利用可能な最もスマートなモデルを含む5つの異なるモデルをテストしました。

大きな発見:知っているが、言わない

結果は衝撃的でした。「アラーム」は完璧に機能したのです。モデルが間違いを犯したとき、検出器はモデルの内部的な脳波を見て、ほぼ100%の精度(具体的には、あるモデルでAUROCスコア0.997)でエラーを特定できました。それはまるで、モデルの脳が「エラー!エラー!」と叫んでいるかのようでした。

しかし、ここにひねりがあります。モデルは自分自身のアラームを聞いていなかったのです。

内部のアラームが鳴り響いているにもかかわらず、モデルの最終的な答えは、あたかも正解であるかのように自信に満満でした。エラーを完璧に見抜いていた検出器は、最終的な答えが間違っているかどうかを予測することには全く役に立ちませんでした。それは、トーストを焦がしたときに「火事だ!」と叫ぶ煙探知器がある一方で、消防隊(モデルの最終回答)が到着して「火事ではありません、大丈夫です」と言うようなものです。

この論文は、人々が真実であると期待するいくつかの事項を明確に否定しています。

  • 自信は手がかりにならない: モデルに自信の度合いを尋ねても、モデルは単に「はい」か「ノー」という二値的な回答を示すだけで、何のニュアンスもありませんでした。99%確信しているモデルも、50%の確信しかないモデルも、間違いを犯す確率は同様でした。
  • 深く考えることは助けにならない: 彼らは、モデルに思考プロセスをステップ・バイ・ステップで書き出させる「思考モード(Chain-of-Thought)」を試しました。これにより、モデルが自らの間違いに気づけるようになるのではないかと考えられました。しかし、実際には、これはモデルが正解を得る能力を悪化させ(精度が27.9%から1.2%に低下)、かつ内部のアラームが鳴り続けているという事実を変えることはありませんでした。モデルは自分が間違っていることを知っていましたが、それについて話すことは解決にはならなかったのです。

どうすれば直せるのか? 「分岐と選択(Branch-and-Pick)」戦略

モデルが間違いを認めないため、研究者たちは彼らの「セーフティネット」として機能しようと試みました。彼らは内部のアラミを聞き取り、モデルが答えを出し終える前に間違いを修正しようとするシステムを構築しました。彼らは3つの介入方法をテストしました。

  1. 再プロンプト(Reprompt): 単にモデルに「おい、自分の仕事を確認しろ!」と言うこと(これはあまりうまくいきませんでした)。
  2. 事前置換(Replace-Prior): 間違ったステップを消去し、最初からやり直させること。これは結果が分かれました。いくつかの間違いを救いましたが、正解を誤って壊してしまうこともありました。
  3. 分岐と選択(Branch-and-Pick): これが勝者でした。アラームが鳴ったとき、システムは単に推測するのではなく、モデルに次のステップを(異なるランダム性のレベルを用いて)4通りの方法で試させました。そして、内部のアラームを使用して、最も「クリーンな(破損の可能性が低い)」経路を選択しました。

この「分岐と選択」法は、正解を壊すことなく、一貫して間違いを救うことができた唯一の方法でした。特定のモデル(Llama-3.1-8B)において、これは4つの間違いを救い、0個の正解を壊しました。しかし、論文では、これはあらゆる状況に対する魔法の杖ではないことも注記されています。成功するかどうかは、どのような種類のミスがなされたかに大きく依存していました。例えば、「単位の間違い」を直すのは上手くいきましたが、「パーセンテージの間違い」を直そうとすると、かえって状況を悪化させました。

まとめ

この論文は、モデルの言葉を、それが正しいかどうかを判断する材料として信頼することはできないと結論付けています。モデルは、自信を持って間違った答えを届けながら、内部では災厄を認識している可能性があるのです。「知っていることと言っていることのギャップ(Knowing-Saying Gap)」は実在し、かつ危険です。

解決策は、モデルにもっと正直になるよう求めることではなく、「モデルを意識した」安全システムを構築することです。私たちは内部のアラーム(プローブ)に耳を傾け、「分岐と選択」のようなスマートな戦略を用いてエラーを捕らえる必要があります。しかし、注意も必要です。あらゆる種類の間違いやあらゆるモデルに対して機能する単一の解決策は存在しません。安全なAIの未来は、チャットボットの自信を信じることではなく、チャットボットが自分自身に嘘をついているときにそれを察知できるガードレールを構築することにあるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →