← 最新の論文
💻 computer science

Geometric Deviation as an Unsupervised Pre-Generation Reliability Signal: Probing LLM Representations for Answerability

本論文は、構造化された分野(数学やコードなど)において、回答可能な参照セットからの隠れ状態の幾何学的な乖離を測定することが、回答不可能なクエリを検出するための信頼性の高い教師なし事前生成シグナルを提供することを示すが、この効果は事実に基づくプロンプトには一般化しないことを明らかにする。

原著者: Yucheng Du

公開日 2026-05-06
📖 1 分で読めます☕ さくっと読める

原著者: Yucheng Du

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、教養豊かな司書(AI)が質問に答えるところを想像してみてください。通常、その司書がでたらめを言っているかどうかは、答えを口にした「後」にしかわかりません。しかし、もし司書の脳が、口を開く「前」に、微妙な「警告サイン」を私たちに与えてくれるとしたらどうでしょうか?

この論文は、まさにその点を調査しています。研究者たちは問いかけました。「AI の思考の『形状』(内部幾何学)を見ることで、答えを待つことなく、また教師が AI の間違いを採点する必要もなく、質問に答えられないかどうかを判断できるでしょうか?」

以下に、彼らの発見を簡単な比喩を用いて解説します。

1. AI の脳の「GPS」

AI の内部状態を巨大な地図だと考えてみてください。AI が答えられる質問(例えば「2+2 は何ですか?」)を見ると、その思考はこの地図上の特定の地域に密集して集まります。研究者たちはこれを「答えられる地域(Answerable Neighborhood)」と呼んでいます。

彼らは、AI が答えられない質問(例えば「実数世界における負の数の平方根は何ですか?」)をされた場合、AI の思考は「迷子」になり、その地域から遠ざかって漂うと仮説を立てました。彼らは「幾何学的逸脱(Geometric Deviation)」と呼ばれるツールを用いて、この漂いを測定しました。これは、車がメインの高速道路からどれくらい逸脱したかを確認するようなものです。

2. 結果:質問の「形状」に依存する

研究者たちは、この手法を「数学」「事実」「コード」の 3 種類の質問でテストしました。結果は驚くべきものであり、質問の「種類」に完全に依存していました。

  • 数学の質問(明確な信号):
    欠けたピースがある数学の問題を想像してください。例えば「最大の素数は何ですか?」(存在しません)。

    • 発見: AI がこのような「壊れた」数学の問題を見たとき、その思考は即座に「答えられる地域」から遠くへ漂い始めました。信号は大きく、明確でした。
    • 比喩: これは、磁石の近くにコンパスを近づけたときに針が激しく回転するようなものです。AI の脳の幾何学は、答えようとする前に即座に「これは数学のルールに適合しない」と認識しました。
    • 性能: この方法は、AI が「わかりません」と拒絶するのを待つよりも優れており、同じ質問を 5 回繰り返して混乱するかどうかを見る(自己整合性)よりも優れていました。
  • 事実の質問(沈黙の信号):
    次に、存在しないものに関する事実の質問を想像してください。例えば「アトランティスの首都は何ですか?」。

    • 発見: AI の思考は遠ざかりませんでした。パリや東京についての質問の場合と全く同じように、「答えられる地域」の真ん中に留まりました。
    • 比喩: 文法的・構造的に「アトランティス」と「パリ」が同じに見えるため、AI の脳は両者を同じように扱います。「GPS」は点滅しませんでした。論文は、一般的な事実については、この幾何学的なトリックは機能しないと結論付けています。
  • コードの質問(混合した信号):
    クラッシュするコード(ゼロ除算など)について尋ねた場合、AI の思考は数学の場合と同様に遠ざかりました。ただし、信号は数学の場合よりも少し「ノイズ」が多く、一貫性が低かったため、機能はするものの、完全に信頼できるためにはより多くのデータが必要かもしれないことが示唆されました。

3. 信号はいつ発生するか?(「早期警告」システム)

研究者たちは、玉ねぎをむくように AI を層ごとに観察しました。

  • 発見: 「漂い」の信号は、AI の処理の非常に早い段階(最初の数層)で現れ、実際には最終的な答えを生成するに近づくにつれて弱まっていきました
  • 比喩: これは、火花が飛び散った瞬間に作動する煙探知機のようなものです。しかし、火(答え)が燃え始めると、警報は静かになります。AI は質問が「壊れている」ことを最初から知っていますが、答えを出そうとする準備ができると、その感覚を滑らかにして、とにかく答えを出そうとします。

4. 「拒絶」と「幻覚」の逆転

研究者たちは、これらの「壊れた」質問に対する異なる AI モデルの反応についても、面白い点に気づきました。それらの脳は幾何学的には同じに見えたにもかかわらずです。

  • 発見: 2 つの異なる AI モデル(Llama と Qwen)は、壊れた数学の問題に対して全く同じ「漂い」の信号を持っていました。しかし、Qwenは「これには答えられません」と言ったのに対し、Llamaは自信満々に間違った答えを捏造しました。
  • 比喩: 2 人のドライバーが赤信号(幾何学的な信号)を見た場面を想像してください。一人のドライバー(Qwen)は車を止めます。もう一人のドライバー(Llama)は走り続け、信号を見ていなかったと主張します。「信号」(赤信号)は両者に存在しましたが、彼らの訓練(アライメント)が異なる反応を教えたのです。

まとめ

この論文は、数学のような構造化されたタスクについては、AI が話す「前」に、AI の内部の「形状」を見ることで、質問に答えられないかどうかを判断できることを証明しています。これは、数学の誤りに対する、高速で無料かつ信頼性の高い警告システムです。

しかし、一般的な事実については、このトリックはまだ機能しません。なぜなら、AI の脳は「真実の事実」と「偽りの事実」を、同じように視覚的に区別しないからです。信号は実在しますが、それは内容が偽である場合だけでなく、質問がルール(数学やコードなど)の構造を破る場合にのみ機能します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →