← 最新の論文
🤖 AI

LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?

本論文は、基礎的なタスクと組み立て計画を通じてマルチモーダル大規模言語モデル(MLLM)の多段階的な空間推論能力を評価するベンチマークであるLEGO-Puzzlesを紹介しており、最強のモデルであっても人間と比較して大幅に性能が劣っていること、および計画の複雑さが増すにつれて正確性を維持することに苦慮することを明らかにしている。

原著者: Kexian Tang, Junyao Gao, Yanhong Zeng, Haodong Duan, Yanan Sun, Zhening Xing, Wenran Liu, Kai Chen, Kaifeng Lyu

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Kexian Tang, Junyao Gao, Yanhong Zeng, Haodong Duan, Yanan Sun, Zhening Xing, Wenran Liu, Kai Chen, Kaifeng Lyu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたはロボットに、ブロックを使って複雑なお城を作る方法を教えようとしていると想像してください。ただし、あなたにできるのは、言葉で話し、写真を見せることだけです。これが、**マルチモーダル大規模言語モデル(MLLM)**の世界です。これらのモデルを、テキストを読み、画像を「見る」ことができる超スマートなデジタル脳だと考えてください。彼らは人間と同じように世界を理解しようとしています。あらゆる脳にとって最も難しい学習の一つは、空間推論、つまり、物体がどのように3D空間に適合するか、どのブロックを上に置くべきか、どのパーツを回転させる必要があるか、そしてパーツを追加するにつれて構造全体がどのように変化するかを理解する能力です。これらのAIモデルは、チャットをしたり画像を説明したりすることには長けてきていますが、科学者たちはまだ疑問を抱いています。彼らは、何かを作り上げるための一連の動きを実際に「計画」できるのだろうか? 完成した塔を見て「それは高い」と言うのと、ゼロから構築するために正確に50のステップの順序を導き出すのは、全く別の課題です。もし私たちが、ロボットに車の修理をさせたり、家具の組み立てを手伝わせたりしたいのであれば、彼らはこのようなステップ・バイ・ステップの思考をマスターする必要があります。

そこで、研究者たちがまさにこのスキルをテストするために設計した新しい「試験」であるLEGO-Puzzlesが登場しました。実際のプラスチック製のブロックを使う代わりに、研究者たちはLEGOの組み立て説明書を用いた巨大なデジタル遊び場を作成し、世界で最も賢いAIモデルがどれだけ空間パズルを扱えるかを検証しました。彼らはこのテストを2つの主要なレベルに分類しました。最初のレベルである**Elementary Set(初級セット)は、ウォーミングアップのようなものです。これはAIに対して、単一の画像に関する単純な質問を投げかけます。「どちらのブロックが高いですか?」「これら2つのパーツは接していますか?」「もしこのパーツを回転させたら、横から見るとどのようになりますか?」といった具合です。これは基本的な「空間理解」をテストするものです。第2レベルのPlanning Set(計画セット)**は、真のボス戦です。ここでは、AIは単に質問に答えるだけでなく、マスター・ビルダーのように振る舞わなければなりません。AIにはブロックの初期の山と完成図の画像が与えられ、そこに至るまでのステップ・バイ・ステップの計画を生成しなければなりません。研究者たちは、GPT-5やGeminiといったビッグネームを含む、利用可能な最も高度な29のAIモデルをテストし、さらに人間の専門家にも同じテストを受けさせました。

結果は、AI界にとって現実を突きつけるものでした。最強のモデルでさえ、基礎的な部分で苦戦したのです。初級の質問において、最高のAIモデルは人間のパフォーマンスから少なくとも20%遅れていました。例えば、3D空間におけるブロックの高さを判断するように求められた際、多くのモデルは、画面上の平坦な2D画像を見るだけで、真の3D形状を想像することができず、混乱してしまいました。しかし、タスクが長くなるにつれて、問題はさらに悪化しました。AIが選択肢形式を用いて一連のステップを計画しなければならない場合、計画が3ステップを超えると精度は著しく低下し始め、50%を下回りました。計画に8ステップを要するようになると、最高のモデルの精度は**0%**まで落ち込みました。対照的に、人間の参加者は、ステップの連鎖がどれほど長くても、すべての計画タスクを完璧に解きました。

研究者たちはさらに難しい試みも行いました。AIに対し、単にステップを説明するだけでなく、組み立てプロセスの途中の状態を実際に描画(ドロー)させることです。彼らは、AIがステップ1の後、ステップ2の後に、お城がどのような見た目になるかを想像できるかどうかを確認したかったのです。結果は残酷なものでした。わずか3ステップという短い計画であっても、モデルは正しい視覚的シーケンスを生成することに完全に失敗しました。彼らは時としてLEGOブロックのように「見える」絵を描くことはできましたが、それを正しい場所に配置したり、向きを正しくしたりすることはできませんでした。論文では、画像生成においてわずか3ステップでモデルがひどく失敗したため、研究者たちはこの特定のタスクについてはそれ以上の長いホライゾン(期間)のテストを行わなかったと記されています。これは、これらのモデルがパターンの認識には優れているものの、自分の行動の結果を時間を追って「想像」する能力に欠けていることを示唆しています。彼らは、組み立てプロセスに関するメンタルマップを頭の中に保持し続けることができず、途中で把握できなくなってしまうのです。

要するに、LEGO-Puzzlesは、現在のAIモデルが非常に印象的ではあるものの、真の空間知能を持つにはまだ程遠い状態であることを明らかにしました。彼らは多段階の組み立てを確実に計画することはできず、物体の将来の状態を視覚化することを求められると無残に失敗します。論文は、AIが物理的な世界を理解し、自律的に物を組み立てたり、壊れたアイテムを修理したり、複雑な環境をナビゲートしたりできるようになるまでには、まだ長い道のりがある、と結論付けています。物理的な世界における人間の直感と機械の計算の間のギャップは依然として広く、この新しいベンチマークは、モデルがどこでつまずいているのかを示す明確な地図を提供しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →