The Riddle Riddle: Testing Flexible Reasoning in Large Language Models and Humans
本論文は、「リドル・リドル(riddle riddle)」パラダイムを導入することで、人間は問題の内容に応じて推論戦略を柔軟に適応させる一方で、大規模言語モデルはしばしばパターンマッチングや表面的な特徴に依存しており、その結果、本来は直截的な問題に対して不適切に創造的な推論を適用してしまうこと、および、真の謎解きにおける彼らの高い性能は、柔軟な推論ではなく記憶の想起に起因している可能性が高いことを示す。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、パズルを解かなければならないゲームをしていると想像してください。中には、既成概念にとらわれない思考(アウト・オブ・ザ・ボックス)を必要とするトリッキーな「謎解き」もあれば、一見すると謎解きに見えるものの、実は単なる単純な算数の問題であるものもあります。
この論文は、AI(大規模言語モデル)が人間と比べてどれほど本当に賢いのかをテストするための、新しい手法を紹介しています。彼らはこれを**「リドル・リドル(謎解きの謎解き)」パラダイム**と呼んでいます。
以下に、彼らが何を行い、何を発見したのかを簡単にまとめます。
設定:「トリック」か「リテラル(字義通り)」か
研究者たちは、表面上はほぼ同一に見える2種類の問いを作成しました。
- 本物の謎解き(トリックあり):
- 例: 「カウボーイが金曜日に町へやってきて、3日間滞在し、金曜日に去りました。これはどのようにして可能なのでしょうか?」
- 答え: 「フライデー(Friday)」が曜日の金曜日ではなく、馬の名前であることを理解しなければなりません。これには独創的な思考が必要です。
- 「リドル・リドル」(リテラル/字義通り):
- 例: 「カウボーイが金曜日に町へやってきて、3日間滞在し、月曜日に去りました。これはどのようにして可能なのでしょうか?」
- 答え: これは単なる単純な算数です。金曜日 + 3日間 = 月曜日。トリックは必要ありません。これにはリテラルな思考が必要です。
重要なのは、両方の問いが同じに見えるという点です。文章の構造もリズムも同じです。違いは、実際に「トリック」が必要かどうかだけです。
実験
研究者たちは、これらを解くために2つのグループに依頼しました。
- グループ1: 現在利用可能な最もスマートなAIモデル9つ(GPT-5、Claude、Geminiなど)。
- グループ2: 100人の成人。
結果:完璧な逆転現象
結果は、まるで鏡を見ているようでしたが、その反射は上下逆さまでした。
1. AIの挙動: 「まず形を見る」解決者
AIモデルは、本物の謎解きには非常に優れていましたが(正答率85%)、「リドル・リドル」では苦戦しました(正答率わずか50%)。
- 何が起きたのか: AIは、問いが「謎解きのような形」をしているのを見ると、即座に「ああ、これはトリックに違いない!独創的で、既成概念にとらわれない思考を使わなければならない」と想定してしまいました。
- 間違いの正体: 問いが単純な算数の問題(リドル・リドル)であったとしても、AIは依然として隠されたトリックを探そうとしました。それは、鍵のかかったドアを見て、ドアがただ解錠されて開いているだけなのに、すぐに「秘密の通路があるはずだ」と思い込む探偵のようなものです。AIは、謎解きにはトリックがあるものだと学習しすぎていたため、トリックを探すのを止めることができなかったのです。
2. 人間の挙動: 「まずリテラル(字義通り)に考える」解決者
人間は、全く正反対のパターンを示しました。人間は**「リドル・リドル」には非常に優れていましたが**(正答率80%)、本物の謎解きでは苦戦しました(正答率50%)。
- 何が起きたのか: 人間は自然と、物事を字義通りに受け止める傾向があります。「金曜日 + 3日間 = 月曜日」という問いを見たとき、彼らは即座に解きました。
- 間違いの正体: 本物の謎解き(馬の名前がフライデー)に直面したとき、人間はしばしば「待てよ、フライデーは曜日の金曜日だ。だからこれは不可能だ!」と考えて行き詰まってしまいました。彼らは、トリックを見つけるために、リテラルな思考を覆すための努力をしなければなりませんでした。
大きな教訓
この論文は、AIはまだ柔軟に「推論」できていないと主張しています。
- 人間は柔軟ですが、怠け者です。彼らはシンプルでリテラルな答えを好み、行き詰まったときに初めて「創造モード」へと切り替わります。
- AIはその逆です。AIは「謎解きのような構造 = 創造的な答え」ということを暗記しています。AIは、創造的な答えが本当に「必要」かどうかをチェックしているのではなく、問いの形を見て、自動的に「創造的な道具箱」を取り出しているのです。
著者たちはこれを**「推論の錯覚」**と呼んでいます。視覚的な錯覚の絵において、線が実際には異なる長さであっても、錯覚を見てしまうのと同様に、AIは単なる単純な算数の問題であっても、そこに「謎解きのトリック」を見てしまうのです。
結論
論文は、AIが有名な謎解きに対して正解を出すことはできるものの、それは単に記憶を呼び出しているか、あるいは厳格なルール(「もし謎解きのように見えたら、トリックを使え」)に従っているだけかもしれない、と結論づけています。AIは、「この問題には本当にトリックが必要なのか、それとも普通に解けるのか?」と立ち止まって自問する、人間的なスキルをまだ習得していません。
要するに、AIは、たとえその箱が空っぽであっても、箱に「謎解き」というラベルが付いている限り、常に箱の外側を考えようとします。人間は通常、箱の中に留まり、どうしても必要になったときだけ外側を見ようとするのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。