PolyComp: A Polycube-based Benchmark for Compositional 3D Spatial Reasoning in Multimodal Models
本論文は、マルチモーダルモデルにおける構成的な3D空間推論を評価するために設計された、120個の問題からなる手続き型生成ベンチマークであるPolyCompを紹介しており、GPT-5.6 Solのような高度なモデルが中程度の精度(50%)を達成している一方で、コストや提示形式が異なる他のモデルはランダムな推測に近いレベルで苦戦していることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人間の精神は、複雑な形を分解し、それらがどのように組み合わさるかを想像するという、静かで、ほとんど本能的な才能を備えています。私たちはパズルのピースや壊れたおもちゃ、あるいは積み上げられた箱を見たとき、すべての面が見えていなくても、各パーツが全体とどのように関連しているかを瞬時に視覚化することができます。空間推論として知られるこの能力は、私たちが物理的な世界をナビゲートする方法の基礎となっています。数十年にわたり、科学者たちは、画像を見たりテキストを読んだりできる新しい世代の人工知能が、これと同じ空間感覚を開発したのかどうかという疑問を抱いてきました。これらの機械は写真の中の猫を認識したり記事を要約したりすることには長けていますが、物体の三次元的な幾何学構造を真に理解しているのか、それとも単に以前見たパターンに基づいた推測をしているだけなのかは、依然として不明なままです。
新しい研究は、単純な画像認識を超え、形や組み立てに関する機械の思考の核心を探るために設計された、厳格なテストを紹介しています。研究者たちは、ブロック状の立方体構造からなる120個の視覚的パズルを集めた「PolyComp」というベンチマークを作成しました。各パズルでは、いくつかの連結された立方体で作られたターゲットとなる物体が、2つの異なる角度からAIに見せられます。その後、4つの異なる小さなパーツのペアが提示され、どのペアを回転させ移動させれば、元のターゲットを完璧に再現できるかを特定するよう求められます。このタスクは、モデルにパーツの3D表現を精神的に構築させ、それらが空間内でどのように回転するかをシミュレートさせ、隙間や重なりなく適合するかどうかを検証することを要求します。これは記憶力や言語能力のテストではなく、純粋な幾何学的論理のテストなのです。
この研究では、最も高度な3つの人工知能システムをテストにかけました:GPT-5.6 Sol、Claude Fable 5、そしてGemini 3.1 Pro Previewです。各システムに対して同じ120個のパズルを解かせましたが、画像の形式が推論を助けるのか、あるいは妨げるのかを確認するために、パズルを3つの異なる方法で提示しました。ターゲットと選択肢が単一の画像内に一緒に表示されることもあれば、ターゲットが1つの画像に示され、4つの選択肢が汎用的なラベルまたは記述的な名前と共に4つの別々の画像に分割されて示されることもありました。目的は、視覚情報を小さな塊に分割することが作業を容易にするのか、それとも情報の提示方法に関わらずモデルが苦戦するのかを見極めることでした。
結果は、人間レベルの直感と現在の機械の能力との間の大きな隔たりを明らかにしました。最も優れたパフォーマンスを示したモデルであるGPT-5.6 Solは、パズルの半分のみを正解し、精度は50パーセントでした。2番目のモデルであるClaude Fable 5は約39パーセントを解き、3番目のGemini 3.1 Pro Previewはランダムな推測に近いレベル、つまりわずか27.5パーセントの正解率でした。すべてのパズルに4つの選択肢があるため、コンピュータが盲目的に推測した場合、25パーセントの正解が期待されます。これは、最も高度なモデルであっても、かろうじて偶然よりはマシなレベルであり、最も能力の低いモデルは実質的に推測しているに過ぎないことを意味します。また、形状の種類が提示方法よりも重要であることも判明しました。モデルは、パーツが輪のような構造を作る長方形のループを含むパズルで最も苦戦しましたが、単純なブロックが分割されたり結合されたりしているように見えるパズルでは、わずかに高い成績を収めました。
興味深いことに、パズルの見せ方は結果に劇的な差をもたらしませんでした。画像を別々のファイルに分割したり、記述的なラベルを追加したりしても、モデルのスコアが大幅に向上することはありませんでした。このことは、問題がモデルの画像を鮮明に捉える能力にあるのではなく、物体に対して安定した内部3Dモデルを構築し、その動きをシミュレートする能力が欠如していることにあることを示唆しています。研究者たちは、モデルが成功したときは、パーツが非常に明らかな全体像を持っていたり、大きな平らな面があったりして、照合が容易であったことが多かったと指摘しています。パズルが小さな隠れた角を追跡したり、中空の空間にどのようにパーツが収まるかを判断したりする必要がある場合、モデルは一貫して失敗しました。
この研究はまた、この種の深い推論に伴うコストについても浮き彫りにしました。合計360問(120個のパズルを3通りの方法で提示)を解くために、最も有能なモデルは膨大な計算リソースを消費し、標準的な価格設定を使用した場合、1問あたり約1ドルを費やしました。能力の低いモデルは実行コストは低いものの、精度も低くなりました。このトレードオフは、利用可能な最も強力なシステムに対して対価を支払ったとしても、それらが自然に人間が発達させるような基本的な空間知能を依然として欠いていることを示唆しています。研究者たちは、将来のモデルをこの同じ基準でテストできるよう、120個のパズルすべてと、それらを生成するために使用したコードを公開しました。
結局のところ、この研究は明確な診断ツールとして機能しており、人工知能が言語の理解や物体の認識において多大な進歩を遂げた一方で、三次元空間を精神的に操作する能力をまだ習得していないことを示しています。モデルは立方体を説明したり形状を特定したりすることはできますが、2つの別々のパーツが空中での回転や移動を経てどのように組み合わさるかを、まだ信頼性を持って想像することはできません。機械がこれらの内部3Dマップを構築し、その中での変形をシミュレートできるようになるまで、彼らの空間推論は脆弱であり、人間の子供なら容易に解くであろうエラーに陥りやすいままです。この研究は、この能力が機械にとって学習不可能であると主張しているのではなく、現在のシステムがまだそれを達成していないことを断定しており、そのギャップを埋めるための将来の研究への明確な道筋を示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。