Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding
Qwen-3Dは、3D回転位置エンコーディングとクエリベースのセグメンテーションデコーダを活用することで、画像およびビデオにおける空間推論、参照的グラウンディング、およびインスタンスセグメンテーションを統合し、言語と高密度な3D幾何学的予測の間の溝を効果的に埋めつつ、既存の特化型モデルやプロプライエタリなモデルを凌駕する、新しい幾何学認識型の大規模マルチモーダルモデルである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたはロボットに世界の見方を教えようとしているところだと想像してください。長い間、これらのロボットはカメラを持った観光客のようなものでした。彼らは部屋の写真を撮って、「これは椅子です」とか「人が3人います」と言うことはできましたが。これは平面的な写真や短いビデオクリップには最適です。しかし、もしロボットに家全体を歩き回り、キッチンから、廊下から、そして寝室から同じ椅子を見て、その椅子が3D空間のどこにあるかを正確に教えてほしいと頼んだら、事態は複雑になります。ロボットは何千もの個別の2D画像を繋ぎ合わせようとして混乱してしまうのです。それは、何千枚もの平らなポストカードを接着して家を建てようとするようなものです。それは時間がかかり、多くの脳のエネルギーを消費し、現実世界の物事が実際にどこにあるのかを見失ってしまうことがよくあります。
これは「3Dビジョン・ランゲージ・モデル(3D Vision-Language Models)」の課題です。科学者たちは、単に物体を認識するだけでなく、その形状、位置、そして3D環境における他のあらゆるものとの関係性を理解し、同時に人間の指示を聞き取ることができるAIを構築したいと考えています。大きな疑問は、どうすればAIがあらゆる角度から部屋を見渡し、レイアウトを記憶し、データの海の中で迷うことなく正しい物体を指し示すことができるようにできるか、ということです。これが解決できれば、ロボットはようやく私たちの家をナビゲートしたり、失くした鍵を見つけるのを手伝ったり、あるいは複雑な建設作業を補助したりできるようになり、「見る」ことを超えて、周囲の空間を真に「理解する」ことができるようになるでしょう。
そこで登場するのが、デジタル世界における熟練の建築家のように振る舞う、カーネギーメロン大学の研究者によって開発された新しい種類のAI、Qwen-3Dです。Qwen-3Dは、すべてのビデオフレームを個別の平らな写真として扱うのではなく、巧妙なことを行います。それは、それら異なる視点をすべて取り込み、単一の持続的な3Dマップへと「溶かし合わせる」ことです。彫刻をさまざまな角度から撮影した写真を、瞬時に思考の中で回転する立体的な像へと融合させることを想像してみてください。それが、このモデルがビジュアルデータに対して行うことです。このモデルは、奥行き情報(物までの距離)とカメラの位置を使用して、長くうねるようなビデオストリームをコンパクトな3D表現へと圧縮します。これにより、AIは一度に一つのフレームに固執することなく、シーン全体として推論することが可能になります。
論文では、AIに3Dスキルを教えるこれまでの試みには大きなボトルネックがあったと主張しています。古いモデルは、3Dの場所をテキストとして書き出したり(例:「椅子は座標1.2, 0.8, 0.9にあります」)、あるいはあらかじめ用意された物体のリストから選択したりすることで、3Dの場所を記述しようとしてきました。著者らは、これらの手法は、複雑な絵画を限られたセットの絵文字だけで説明しようとしたり、あるいはあらかじめ印刷されたステッカーが最適かどうかを推測したりすることに似ていると述べています。それは不器用で非効率的なコミュニケーション方法です。Qwen-3Dは、AIの「脳」(言語推論)を、特定の3Dシーンのパーツを指し示すことができる「手」(セグメンテーション・デコーダー)に直接接続することで、この問題を解決します。座標を推測する代わりに、ユーザーが話している対象がベッドの上の枕であれ、街中の信号機であれ、その物体の正確な形状を強調するように学習するのです。
その結果は極めて印象的です。さまざまなベンチマークでテストされた際、Qwen-3Dは既存の3D AIモデルを凌駕し、3D空間を理解するという点ではいくつかの主要なプロプライエタリな2Dモデルをも上回りました。具体的には、研究者たちは、Qwen-3Dが従来の最高の手法と比較して、3Dビジュアル・グラウンディング(記述に基づいた物体の発見)を4%向上させ、3Dインスタンス・セグメンテーション(シーンから個々の物体を分離すること)を13%向上させたことを発見しました。驚くべきことに、これは標準的な2D画像やビデオを理解する能力を失うことなく達成されました。これは、3Dでの見方を教えることが、2Dでの見方を忘れさせることにならないことを証明しています。
しかし、著者らは、これがまだあらゆる状況に対する魔法の杖ではないことにも注意深く言及しています。現在のモデルは、世界が主に静止していることを前提としており、車が猛スピードで走り抜けるような、物体が動いたり形を変えたりするダイナミックな環境では苦戦します。また、深度やカメラの位置を推定するために外部ツールに依存しているため、もし初期の測定が間違っていれば、AIの理解もわずかに狂う可能性があります。これは、言語と3D知覚の間の溝を埋めるための重要な一歩ではありますが、将来の研究では、これらの動的な対象に対処し、おそらく幾何学を自ら推定できるようになる必要があるだろうと研究者らは示唆しています。現時点では、Qwen-3Dは、より良い3D AIへの鍵は単に優れたデータにあるのではなく、AIが見ているものと、AIが話す方法をよりスマートに結びつける方法にあることを示唆する、強力な新しいツールとして立っています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。