← 最新の論文
💬 NLP

When Models Know More Than They Say: Probing Analogical Reasoning in LLMs

この論文は、オープンソースの LLM において、表面的な手がかりに依存しない比喩的推論の検出能力が、プロンプトによる評価よりも内部表現のプロービングの方がはるかに高いことを示し、特に修辞的アナロジーにおいて内部表現と出力行動の間に非対称性が存在することを明らかにしています。

原著者: Hope McGovern, Caroline Craig, Thomas Lippincott, Hale Sirin

公開日 2026-04-07
📖 1 分で読めます☕ さくっと読める

原著者: Hope McGovern, Caroline Craig, Thomas Lippincott, Hale Sirin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「AI(大規模言語モデル)は、私たちが思っている以上に『深く理解』しているかもしれないが、それを『言葉にして答える』のが苦手な場合がある」**という、とても面白い発見を報告しています。

タイトルを日本語に訳すと**『モデルは言っている以上のことを知っている:LLM における類推推論の探査』**となります。

これを、難しい専門用語を使わずに、**「天才的な料理人」「料理のレシピ本」**の例えを使って説明してみましょう。

1. 物語の「型」を見つけるゲーム

まず、この研究が行っているのは、「物語の型(パターン)」を見つけるゲームです。

  • 例え話:
    • 物語 A: 「小さな村の少女が、何度も失敗して泣きそうになるが、それを乗り越えて強くなり、最終的に尊敬されるようになった。」
    • 物語 B: 「起業家が大変な苦労をしながら会社を立ち上げ、涙を流したが、後悔はしていない。『一番美味しい金(ゴールド)は、一番熱い炉を通るものだ』と気づいた。」

これら 2 つの物語は、登場人物も場所も全く違います。でも、**「苦難を乗り越えて強くなる」という「型(パターン)」**は同じです。人間なら、すぐに「あ、これ同じ話だね!」と気づけます。

この研究では、AI にこの「同じ話」を見つけさせるテストを行いました。

2. 2 つのテスト方法:「口頭で答える」vs「脳内を覗く」

研究者たちは、AI の能力を測るために、2 つの異なる方法を使いました。

方法 A:プロンプト(口頭で答える)

これは、私たちが普段 AI に使う方法です。「この 2 つの話は似ている?似ていない?理由も教えて」と直接聞いて、AI が答えるのを待ちます。

  • 例え: 料理人に「この 2 つの料理は味が似ている?教えて」と口頭で質問することです。

方法 B:プロービング(脳内を覗く)

これは、AI の内部(ニューラルネットワークの重み)を直接チェックして、「AI の頭の中に、この 2 つの話が似ているという情報が隠れていないか」を調べる方法です。

  • 例え: 料理人の脳内を直接スキャンして、「この 2 つの料理が似ているという知識が、彼の頭の中にちゃんと保存されているか」を調べるようなものです。

3. 驚きの結果:2 つのタイプの「物語」で結果が真逆だった

この研究でわかったのは、「物語の種類」によって、AI の振る舞いが全く違うということです。

① 修辞的(リトリアル)な類似性:「言葉の遊び」

これは、文章の**「リズム」や「文法構造」が似ている**パターンです(例:「A は B を傷つけた、C は D を傷つけた」という並列構造)。

  • 結果:
    • 脳内を覗くと(プロービング): 「うん、これ似てるね!」と93%の正解率で、AI の頭の中には完璧に知識が保存されていました
    • 口頭で聞くと(プロンプト): 「えーと、よくわかりません…」と**18%**しか正解できませんでした。
  • 解説:
    これは、「天才料理人が、脳内には完璧なレシピ(知識)を持っているのに、口頭で説明するときは、なぜか『味がわからない』と嘘をついている(あるいは説明できない)」ような状態です。
    AI は「似ている」という構造を
    見抜く力
    は持っていますが、それを言葉として出力するのが苦手だったのです。

② 物語的(ナラティブ)な類似性:「話の筋」

これは、先ほどの「苦難を乗り越える」といった、物語全体のストーリーやテーマが似ているパターンです。

  • 結果:
    • 脳内を覗くと: 「似てるね」の確率は**35%**程度。
    • 口頭で聞くと: 「似てるね」の確率も**35%**程度。
  • 解説:
    こちらは、**「脳内にも、口頭でも、どちらもあまり得意ではない」**状態です。AI は、表面的な言葉の並びだけでなく、深い意味での「話の筋」を抽象化して理解するのが、まだ難しいようです。

4. 重要な発見:「知っていること」と「言えること」は違う

この論文の最大のメッセージはここにあります。

  • これまでの常識: 「AI が正解を言えないなら、AI はそのことを理解していないのだ」と思われていました。
  • 今回の発見: 違います! AI は内部で「似ている」と理解しているのに、それを言葉にして答えることができない(出力できない)場合があります。

特に、オープンソースのモデル(誰でも使える無料の AI)では、この**「知っているのに言えない」ギャップ**が非常に大きかったのです。一方、最新の巨大なモデル(Claude や GPT-5 など)は、このギャップが小さく、内部の知識をうまく言葉にできていました。

まとめ:私たちが学ぶべきこと

この研究は、**「AI の能力を測るには、ただ『聞いてみる(プロンプト)』だけでは不十分」**だと教えてくれます。

  • 例え話:
    料理人の腕前を測るのに、「口頭でレシピを言わせる」ことだけを見て、「彼は料理がわからない」と判断するのは間違いかもしれません。もしかしたら、彼は**「脳内には完璧な料理の知識を持っているのに、説明するのが下手なだけ」**かもしれません。

私たちが AI を評価するときは、「AI が何と言っているか(出力)」だけでなく、「AI の頭の中(内部表現)に何が隠れているか」も一緒に見る必要があるのです。そうすることで、AI が本当に何を知っていて、どこが苦手なのかを、より正確に理解できるようになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →