← 最新の論文
🤖 AI

Human-Level Reasoning: A Comparative Study of Large Language Models on Logical and Abstract Reasoning

本研究は、8つの独自に設計された設問を用いて、9つの著名な大規模言語モデルの論理的および抽象的な推論能力を人間のパフォーマンスと比較・評価し、それらのモデルの演繹的能力における顕著な格差を明らかにしている。

原著者: Benjamin Grando Moreira

公開日 2026-06-19
📖 1 分で読めます☕ さくっと読める

原著者: Benjamin Grando Moreira

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたの目の前には、驚くほど有能な司書たちが集まった部屋があります。これらの司書たち(大規模言語モデル、いわゆるLLM)は、世界のほぼすべての本を読み終えています。彼らは事実を暗唱し、詩を書き、誰よりも速く翻訳を行うことができます。しかし、この論文が問いかけているのは、**「彼らは本当に読んでいる内容を『理解』しているのか、それとも単に次の単語を予測するのが非常に上手いだけなのか?」**ということです。

これを知るために、著者であるベンジャミン・グランド・モレイラ(Benjamin Grando Moreira)は、「ロジック・ジム(論理の訓練場)」を設置し、15体のデジタル司書たちを、人間の学生や教授のグループと競わせました。

以下は、日常的な比喩を用いた、何が起きたのかの簡単な内訳です。

テスト:トリビア・クイズではなく、パズル・ボックス

研究者は、モデルに「初代大統領は誰ですか?」(これは記憶によって答えられるもの)と聞く代わりに、8つのトリッキーなパズルを与えました。これらのパズルは、単なる事実の想起ではなく、隠されたルールを解き明かす必要がある**「謎解き」**のようなものでした。

次のように考えてみてください:

  • 人間の脳は、手がかりを探し、点と点を結びつけ、「なるほど!パターンが見えたぞ!」と言う探偵のようなものです。
  • AIの脳は、「この単語を以前見たことがあるから、次に続くのが普通な単語を予測しよう」と考える、超高速のパターンマッチング・マシンのようなものです。

8つの挑戦(「障害物コース」)

論文では、以下のような項目でモデルをテストしました:

  1. 曜日の謎解き: もし「SUN + 1 = MON」なら、「TUE + 2」は何になるか?(ほとんどのモデルはこれを解けましたが、一部のモデルは略称によって混乱しました)。
  2. 象の歌: 象の数が奇数か偶数かによって、「bother」という言葉を言う回数が変わるおかしなパターンです。人間はこのパターンを簡単に理解しましたが、多くのAIは繰り返しの部分で行き詰まりました。
  3. 秘密のコード: 単純な文字のシフト(例:AがBになる)。ほとんどのモデルはこのコードを解きましたが、一部のモデルは大文字・小文字の区別を間違えました。
  4. ひっかけ数学問題: 「3 + 3 x 5 は?」 正解は18です。しかし、テストの選択肢には16、20、30、45がありました。18は選択肢にすらありませんでした!
    • 仕掛け: 多くのモデル(そして一部の人間も)が混乱しました。彼らは計算は合っているのに選択肢が間違っていることに気づき、正解を選ぶ代わりに、単に「最も近い」間違った答えを選んでしまいました。
  5. 月のミステリー: これが最も難題でした。「May(5月)」の隠されたコードを見つける問題です。そのコードは、月の数字を二乗し(5の二乗 = 25)、さらに「May」という単語の文字数(4文字)を数え、それらをくっつけて「254」にするというものでした。
    • 結果: 人間はこの問題には比較的対応できましたが、AIはほとんど失敗しました。彼らは単純な「数字をくっつける」というトリックを見つける代わりに、適合しない複雑な数学公式を使おうとしてしまいました。
  6. 言語の切り替え: ポルトガル語の月の略称をスペイン語の名前に一致させる問題。スペイン語を知らない人間は苦戦しましたが、多言語を知っているAIはこの問題を完璧にこなしました。
  7. バイリンガル・デイ: 英語とポルトガル語の曜日が混ざっており、いつ言語を切り替えるかについての隠れたルールがあります。人間もAIも、これには手こずりました。
  8. バイナリ・コード: 10進数に見える数字(例えば1000)が、実は2進数である場合を加算する問題。最も賢いモデルだけが、「待てよ、これらは普通の数字ではない!」と気づき、解決できました。

スコアボード:勝者は誰か?

研究者は以下の基準でポイントを与えました:

  • 10ポイント: 正解した場合。
  • 5ポイント: 最終的な数値は間違っていても、論理が合っている場合。
  • 0ポイント: 間違えた、あるいは諦めた場合。

結果:

  • 人間: 教授たち(エキスパート)が、特にトリッキーなパズルにおいて最も高いスコアを記録しました。学生も健闘しましたが、抽象的な謎解きではより苦戦しました。
  • AI: 平均して、AIのスコアは約73点(100点満点)であり、人間のスコアは約70点でした。
    • あれ、AIが勝ったのですか? はい、わずかに勝ちました!しかし、ここには落とし穴があります。AIは、簡単なこと(異なる言語での月の名称を知ることなど)には非常に優れていましたが、奇妙で抽象的なこと(象の歌や隠された数字のコードなど)には非常に弱かったのです。
    • 最も優れたAIモデル(GPT-4oやClaudeなど)はほぼ満点に近いスコアを出しましたが、より弱いモデル(Sabiá 3など)のスコアは非常に低くなりました。

大きな教訓

この論文は、これらのAIモデルは**「天才的なオウム」**のようなものであると結論付けています。彼らは人間の会話を模倣し、標準的な問題を完璧に解くことができます。しかし、枠にとらわれない思考を求められたり、奇妙なパターンを見つけたり、あるいは質問自体が「ひっかけ」であると気づいたりする必要があるとき、彼らはしばしばつまずきます。

  • 人間は、新しいルールを即座に理解する「流動性知能」に長けています。
  • AIは、すでに記憶している膨大なデータを利用する「結晶性知能」に長けています。

この研究は、AIが会話において恐ろしいほど上手くなっている一方で、ルールの仕組みが隠されていたり特殊だったりする場合、人間のように「考える」技術をまだ完全には習得していないことを示しています。AIは依然として、背後にある論理を真に理解しているのではなく、主に過去に見た経験に基づいた「推測」を行っているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →