← 最新の論文
💬 NLP

Do AI Models Perform Human-like Abstract Reasoning Across Modalities?

本論文は、AIの抽象的推論を正解率のみで評価することは誤解を招くものであることを示しており、それは、モデルが表面的なショートカットに依存するテキストベースのタスクにおいては能力を過大評価し、モデルが意図された抽象概念を正しく適用できていない場合でもそれを把握していることが多い視覚的タスクにおいては能力を過小評価することになる。

原著者: Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

公開日 2026-02-04
📖 1 分で読めます☕ さくっと読める

原著者: Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、生徒にパズルを出している先生だと想像してください。そのパズルは、パターンの変化(例えば「赤いブロックを左に動かす」など)の例をいくつか示し、その後に、未学習の新しい図形に対して同じルールを適用させるというものです。

長い間、私たちはAIをこのパズルを使ってテストしてきましたが、その「スコアカード」は、AIが最終的な答えをどれだけ正解したかだけをカウントするものでした。AIが正しい図形を出せれば、私たちは「A+」を与えてきました。

この論文は、より深い問いを投げかけています。「AIは本当に『ルール』を理解したのか、それとも単に奇妙なトリックを見つけただけで、運良く当たっただけなのか?」

研究者が発見したストーリーを、分かりやすく説明します。

1. テストの2つの方法

研究者たちは、トップレベルのAIモデル(OpenAIのo3、Claude、Geminiなど)を、2つの異なる方法でテストしました。

  • テキストモード: パズルを、数字と単語のリストとしてAIに与えました(例:「グリッド1には座標2,2に赤い正方形がある……」)。
  • ビジュアルモード: 人間が見るのと同じように、パズルの実際の画像を見せました。

2. 「テキスト」の驚き:高いスコア、浅い理解

AIがテキストモードでテストを受けたとき、驚くほど高い成績を収めました。実際、最高のAI(o3)は、人間の平均よりも高いスコアを獲得しました。

しかし、ここに落とし穴があります。 研究者たちは、AIに「どのようにしてその問題を解いたのか」を説明させました。

  • 人間は通常、「上下のオブジェクトを取り除く」といった、実際の概念を用いて説明します。
  • AIは、提示された特定の例については技術的に正しい説明をしますが、全体像を見失っていることがよくありました。

比喩: 数学のテストを受けている生徒を想像してみてください。先生が「2 + 2 は?」と聞くと、生徒は「4」と答えます。先生が「どうやって出したの?」と聞くと、生徒は「時計を見たら、針が4を指していたので、4だと推測しました」と答えるようなものです。
答えは合っていますが、その推論は「ショートカット(近道)」でした。AIはこれを絶えず繰り返していました。彼らは「オブジェクト」という概念を理解しているのではなく、数字の中にある偶然のパターン(例:「赤は常に数字の3だから、3を取り除こう」など)を見つけ出していたのです。

結論: テキストモードにおけるAIの高いスコアは、その真の知能を過大評価していました。彼らは推論が得意なのではなく、推測が得意だったのです。

3. 「ビジュアル」の驚き:低いスコア、隠れた天才

研究者たちがビジュアルモード(画像を見せる形式)に切り替えると、AIのスコアは急落しました。人間よりも正解率がはるかに低くなったのです。

しかし、研究者たちは再びAIの説明を確認しました。
そこで驚くべきことが分かりました。たとえAIが最終的な図形を間違えたとしても、その「ルールの説明」自体は正しいことが多いことが判明したのです。

比喩: 優れた建築家を想像してください。彼は家の建て方を完璧に説明できます(「レンガを円形に並べて、その上に屋根を載せる」など)。しかし、実際にレンガを積もうとすると、手が不器用なために、レンガを落としたり、置く場所を間違えたりしてしまいます。
ビジュアルモードのAIはこの建築家のようでした。彼らは抽象的な概念(「ルール」)を完璧に理解していましたが、画像を正確に「認識」することに苦労していました。グリッドがどれくらいの大きさなのか、あるいはオブジェクトがどこにあるのかを正確に判別できなかったのです。

結論: ビジュアルモードにおけるAIの低いスコアは、彼らの真の知能を過小評価していました。彼らは論理的には理解していましたが、「知覚」の部分で失敗していたのです。

4. 「ツール」の効果

研究者たちは、AIを助けるために「計算機」(Pythonコード)を与えました。

  • テキストモードでは: 計算機はあまり役に立ちませんでした。AIはすでに論理には長けていましたが、ショートカット(近道)を使う癖がありました。
  • ビジュアルモードでは: 計算機は非常に役に立ちました。AIが画像内のピクセルを数えるためにコードを使用できると、スコアが上昇しました。これは、AIが論理的に「愚かな」のではなく、単に画像を見るための助けを必要としていただけであることを証明しました。

大きな教訓

もし、最終的なスコア(「A+」)だけを見ているのであれば、AIはテキストモードでは天才であり、ビジュアルモードでは失敗作であると考えてしまうかもしれません。

しかし、彼らが「どのように考えているか」を見たとき:

  • テキストでは: 現実の世界では通用しない、巧妙なショートカットを使って「ズル」をしていることが多い。
  • ビジュアルでは: ルールは理解しているものの、実行がうまくいかない「不器用な」天才である。

この論文は、AIが本当に「人間らしく」なっているかどうかを知るためには、単に答えが合っているかどうかをチェックするだけでは不十分であると結論付けています。代わりに、その「推論」が正しいかどうかをチェックしなければなりません。そうでなければ、彼らのテキストスキルの高さを過大評価するか、あるいはビジュアル能力のポテンシャルを過小評価してしまうことになるからです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →