← 最新の論文
💬 NLP

Tracing the ongoing emergence of human-like reasoning in Large Language Models

本論文は、大規模言語モデルが意味論的論理において高い精度を示す一方で、文脈依存的な意味を条件文に付与することを可能にする推論を一般的に再現できず、この能力はモデルのアーキテクチャや訓練の方向性に関わらず未だ発展途上の能力であることを明らかにしている。

原著者: Paolo Morosi, Nikoleta Pantelidou, Fritz Günther, Elena Pagliarini, Evelina Leivada

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Paolo Morosi, Nikoleta Pantelidou, Fritz Günther, Elena Pagliarini, Evelina Leivada

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに人間の会話を理解させることを想像してみてください。そのロボットが単語の定義を知っているだけの超高速辞書なのか、それとも人間が実際にどのように話し、どのように考えるのかという「明文化されていないルール」を本当に習得しているのかを知りたいとします。

この論文は、25 種類の異なる AI モデル(大規模言語モデル、LLM)を対象とした、人間らしい推論に関する特定のテストの成績表のようなものです。以下に、彼らが発見した内容を単純な比喩を用いて詳しく説明します。

テスト:「もし」ゲーム

研究者たちは、「もし」という文を含む古典的な論理パズルを使用しました。人間の会話において、「もし」という文は状況に応じて、非常に異なる 2 つの意味を持ち得ます。

  1. 「取引」(標準的な条件文):
    • 例: 「もし芝生を刈ってくれたら、50 ドルあげるよ。」
    • 人間の論理: 私たちはこれを厳格な取引として理解します。芝生を刈った場合のみ、お金を受け取れます。刈らなかった場合は、支払われません。私たちは「刈らない=お金なし」という隠れたルールを追加します。
  2. 「お知らせ」(ビスケット条件文):
    • 例: 「もしお腹が空いていたら、オーブンにピザがあるよ。」
    • 人間の論理: 私たちはこれを親切なヒントとして理解します。ピザはあなたが空腹かどうかに関わらず、そこにあります。「もし」はピザが存在するための条件ではなく、あなたがそれを必要としているかどうかを確認する単なる方法に過ぎません。

課題: 研究者たちは、人間と AI モデルに、厄介な状況において文の 2 番目の部分(帰結)が真かどうかを判断するよう求めました。

  • シナリオ: 芝生を刈らなかった。お金は受け取れたか?(人間は「取引」のため「いいえ」と答えます)。
  • シナリオ: お腹が空いていない。オーブンにピザはあるか?(人間は「ピザはともかくそこにある」ため「はい」と答えます)。

結果:「文字通り」対「柔軟」

この研究は、人間と AI がこれらのテストを処理する方法に明確な分裂があることを発見しました。

1. 人間は「文脈探偵」
人間は行間を読むのが得意です。芝生を刈るという約束は厳格な取引ですが、ピザについての発言は単なる有益な事実であることを理解しています。私たちは状況に基づいて自動的に理解を調整します。

2. AI モデルは「文字通りのロボット」
AI モデルは一般的に、人間の探偵のように振る舞うことに失敗しました。彼らは主に 2 つの罠に陥りました。

  • 罠 A:「厳格な会計士」
    一部のモデルは硬直したコンピュータプログラムのように振る舞いました。彼らは「もし芝生を刈ったら、払う」という文を見て、「論理的には、もし刈らなかったとしても、条件が満たされなかったため、その文は技術的にはまだ真である」と言いました。彼らは「暗黙の取引」を見逃しました。彼らは厳格な論理にあまりにも集中しすぎて、人間の意味を無視していました。
  • 罠 B:「過剰な修正者」
    他のモデルは、あまりにも賢すぎようとしました。彼らは「もし」という文はすべて厳格な取引であると決めつけました。そのため、「もしお腹が空いていたら、ピザがある」と聞いたとき、「ああ、つまりお腹が空いていなければ、ピザは存在しないのだ」と考えました。彼らは「芝生を刈る」ルールをピザの文に適用しましたが、それは誤りです。

結論: AI モデルは「もし」の辞書的な定義(論理)を知ることにおいては優れていますが、「社会的文脈(語用論)」を理解することにおいてはひどく不得手です。彼らは台本を完璧に暗記した俳優のようですが、キャラクターの感情を理解していないようなものです。

「AI の種類」は関係あったか?

研究者たちは、AI の「性格」や「構造」が結果を変えたかどうか疑問に思いました。彼らは以下を確認しました。

  • オープンソース対クローズドソース: 公開コードを持つモデル(オープン)は、秘密のモデル(クローズド)よりも優れていたか?いいえ。
  • 特化型対汎用型: 「推論」のために特別に構築されたモデルは、汎用チャットボットよりも優れていたか?いいえ。
  • アーキテクチャ: 特定の内部設計(エキスパートの混合)を持つモデルは、標準的なモデルよりも優れていたか?いいえ。

それは、どの車が氷上でよりよく走るかを見るために、異なるブランドの車をテストするようなものでした。驚いたことに、フェラーリかトヨタかに関わらず、すべてが同じように滑りました。これらの「明文化されていないルール」を理解する能力は、より大きく複雑なモデルであることから自動的に得られるものではありませんでした。それは、あるモデルがたまたま持ち、他のモデルが持っていない、特定の出現能力のように見えました。しかし、モデルの仕様を見るだけではそれを予測することはできませんでした。

「文脈からの切り離しバイアス」

著者たちは、この問題を**「文脈からの切り離しバイアス」**と呼んでいます。

ワークシート上の数学の問題は得意だが、友達と夕食の代金を割り勘にするために数学を使うように求められたときに失敗する生徒を想像してください。AI はその生徒のようです。数学(論理)は知っていますが、それを現実生活(文脈)に適用する方法を学んでいません。AI はテキストで訓練されましたが、実際に現実世界に「生きている」わけではないため、時には「もし」が取引を意味し、時には単に「ところで」という意味であることを理解することに苦労します。

まとめ

  • 人間は、厳格な論理と社会的文脈の間を自然に行き来します。
  • AIは、一つの硬直したルール(常に厳格か、常に緩やかか)に固執する傾向があり、ニュアンスを見逃します。
  • 原因: モデルのサイズや「オープンソース」かどうかの問題ではありません。AI は現在、約束と助言の違いを理解するのを助ける「現実世界との接地」を欠いているのです。

この論文は、AI が論理においては向上しているものの、場を読むことや暗黙の意図を理解する「人間らしい」能力はまだ発展途上であると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →