VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?
本論文は、ユーザーのクエリからインタラクティブな3Dオープンワールドを自律的に構築するマルチモーダルエージェントの能力を評価・強化するための統一フレームワークであるVWE-BENCHベンチマークとVibeWorlding-Gym強化学習トレーニング環境を含むVibeWorldingを導入し、強化学習によってオープンソースモデルがこの複雑なタスクにおいて最先端のクローズドソースシステムを凌駕できることを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
空っぽのデジタルルームの中に立ち、コンピューターに向かって、作りたいもののイメージを伝えるだけで、賑やかな街路や、静かな森の開けた場所、あるいは未来的な宇宙ステーションを構築するように頼む場面を想像してみてください。これは「エンボディドAI(身体性を持つ人工知能)」の約束する未来です。これは、人間と同じように、機械が3次元空間と相互作用し、それを構築することを学ぶ分野です。長年、研究者たちは、テキストによる指示に基づいて、家具や木、建物といったデジタルオブジェクトを配置する方法をコンピューターに教えようとしてきました。しかし、これまでの試みの多くは、「ここに椅子を置いて」といった単純で理想化された要求にしか対応できませんでした。ユーザーが「居心地が良く、少し散らかっている書斎」のように、特定の照明や雰囲気を含めたリクエストをした場合、人間同士の会話が持つ、乱雑で自由度の高い性質に直面すると、それらは苦戦しました。さらに、これらの世界を構築するためのツールが分散しており、テスト方法も一貫していなかったため、人工知能がリクエストを真に理解しているのか、それとも単に推測しているだけなのかを知ることは困難でした。
研究チームは、VibeWorldingと呼ばれる新しいフレームワークによって、この課題に取り組みました。彼らは、人工エージェントがユーザーの説明を聞くだけでなく、能動的に計画を立て、適切なデジタルオブジェクトを検索し、それらを3D空間内に配置し、その結果を見てビジョンと一致しているかを確認できる包括的なシステムを作り上げました。研究者たちは、小さな小道具から大きな建物に至るまで、2,600個以上の高品質な3Dオブジェクトを含む大規模なテストグラウンドを構築し、これらを用いて数百の複雑なシーンを作成しました。そして、精密な指示を含むものから、曖昧で自由度の高い望みを含むものまで、数千のユニークなユーザーリクエストを生成し、異なる人工知能がそのタスクをどの程度こなせるかを検証しました。このシステムは厳格な審判として機能し、オブジェクトが正しい場所に置かれているかだけでなく、物理的に理にかなっているか(例えば、テーブルが宙に浮いていないか、あるいは木が壁の中に生えていないかなど)をチェックします。
研究者たちが、主要なテクノロジー企業によるものを含む、今日利用可能な最も高度な人工知能モデルをテストしたところ、現在の能力と、これらの世界を自動的に構築するという目標との間には、大きな隔たりがあることが判明しました。コードを書いたり複雑な質問に答えたりできる最も強力なモデルでさえ、要求されたシーンを構築することに成功しない割合が6割を超えていました。この失敗の主な理由は、ユーザーの言葉に対する理解力の欠如ではなく、3Dの世界を編集するという精密な物理的行為における困難さでした。モデルは、ユーザーが本棚を動かしたいと考えていることは理解していても、距離を誤って計算したり、オブジェクトを間違った方向に動かしたりしてしまい、他のアイテムと衝突させたり、非現実的に浮かせたりしてしまったのです。
このギャップを埋めるために、チームは、子供がブロックで遊んで学ぶのと同様に、試行錯誤を通じて人工知能を教える特化したトレーニング手法を開発しました。このシステムは、エージェントにシーンの構築を試行させ、その結果を物理法則とユーザーの意図に関する厳格なルールに照らし合わせてチェックし、正解した場合にのみエージェントに報酬を与えます。強化学習として知られるこのプロセスにより、研究者たちは、既存の最高水準のクローズドソースモデルを最終的に凌駕できるオープンソースモデルを訓練することができました。300億のパラメータをベースとした彼らの最高の訓練済みモデルは、テストされたすべてのシステムの中で最も高い成功率を達成しました。このモデルは、正しいオブジェクトを検索し、衝突なしに配置し、環境の物理的制約を遵守することを学習し、ユーザーが作りたいと考えている世界の「バイブス(雰囲気)」を効果的にマスターしました。
この研究はまた、これらのモデルが全体像を理解することには長けてきていても、最も困難な部分は依然として空間推論の細部に残されていることを明らかにしました。エージェントは、オブジェクトを正確に7メートル前方に移動させるといった、精密な測定において依然として苦戦しています。しかし、研究者たちは、このトレーニング手法がエージェントの3D空間に関する推論能力を大幅に向上させ、大きな弱点を強みに変えたことを見出しました。チームは、自分たちのデータ、ツール、および訓練済みモデルを公開することで、いつの日かゲーム、シミュレーション、またはバーチャルリアリティのためのインタラクティブな3D世界を、人間のデザイナーと同じような容易さと創造性で構築できるシステムの発展を加速させることを望んでいます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。