← 最新の論文
💻 computer science

MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control

MultiCubeは、グローバルなテキストプロンプトに加えて、特定のパーツレベルのセマンティックおよび空間レイアウトを受け入れることで、独立して制御可能なコンポーネントを持つ高品質な3Dオブジェクトを生成し、精密な構成的3D生成を可能にする新しい2段階の拡散ベースの手法です。

原著者: Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

映画、ビデオゲーム、仮想世界のためのデジタル3Dオブジェクトの作成は、伝統的に多大な労力を要する技術であった。アーティストは、あらゆる車輪、翼、あるいは手足が正確に配置されるよう、複雑なモデルを彫刻し、塗装し、組み立てる作業に何時間も費やしてきた。近年、人工知能がこのプロセスを自動化し始め、単純なテキスト記述から3D形状を生成することが可能になった。しかし、これらの初期のAIシステムは、プロフェッショナルな用途に必要な内部構造を欠いた、単一の固形物(一体型のオブジェクト)を生成することが多い。もし開発者が、動かせる腕を持つキャラクターや、取り外し可能な車輪を持つ車両を必要とした場合、標準的なAI生成モデルは、単なる連続した一つの幾何学的な塊に過ぎないため、使い物にならないことが多い。研究者たちの課題は、コンピュータに単に「形」を作るだけでなく、その形が個別に制御可能な、明確で意味のある複数のパーツで構成されているということを理解させることであった。

ある研究チームは、生成される3Dオブジェクト内の各パーツのアイデンティティ(正体)と位置の両方に対して、クリエイターが精密な制御を行えるように設計された「MultiCube」と呼ばれる新しいシステムを導入した。ユーザーは単にコンピュータに「ロボットを作って」と頼むのではなく、「頭部、2本の腕、4つの車輪」といった具合に、具体的にどのようなパーツを欲しているかを指定し、さらに各パーツが空間内のどこに位置すべきかを正確に伝えることができる。システムはその後、ユーザーの指示通りに完璧に整列した、各コンポーネントが独立した編集可能なパーツとして構成された完全な3Dオブジェクトを生成する。このアプローチは、テキストベースの生成による創造的な自由度と、プロフェッショナルな3Dモデリングに求められる厳格な構造的要件との間の溝を埋めるものである。

MultiCubeの核心となる革新は、指示をどのように解釈するかにある。従来の手法では、テキストのプロンプトと大まかな配置のアイデアを受け取ることはできても、パーツを明確に区別したり、正しい場所に配置したりすることに苦戦することが多かった。MultiCubeは、オブジェクト全体の記述、必要な特定のパーツのリスト、そして各パーツのサイズと位置を定義する「不可視のボックス」という3つの具体的な入力を受け取ることで機能する。例えば、ユーザーが「頑丈な金属製の懐中電灯」と記述し、その構成要素としてハンドル、スイッチ、レンズをリストアップしたとする。次に、ユーザーが仮想空間内に、ハンドル用、スイッチ用、レンズ用の3つのボックスを描く。システムはこのボックスを厳格なガイドとして使用し、生成されたハンドルが最初のボックスの中に収まり、スイッチが2番目のボックスの中に、そしてレンズが3番目のボックスの中に収まるようにしつつ、全体として一貫性のある懐中電灯に見えるようにする。

これを実現するために、研究者たちは2段階のプロセスを構築した。まず、コンピュータは、要求されたすべてのパーツを正しい位置に含む、単一の固形な形状を生成する。これは、各パーツのテキスト記述を、それに割り当てられた特定のボックスに関連付けることを学習することで行われる。「パート・レイアウト・アダプター(Part Layout Adapter)」と呼ばれるシステム内の特殊なコンポーネントが翻訳者の役割を果たし、各パーツの情報を分離して保持することで、コンピュータがどのパーツがどのボックスに属しているのか混乱するのを防ぐ。この固形な形状が作成されると、システムは第2段階へと進み、ユーザーが要求した個々のパーツへと、その固形オブジェクトを慎重に切り分けていく。これにより、最終的な結果は単一のメッシュではなく、完璧に組み合わさる一連の独立した3Dモデルとなる。

この手法による結果は、既存のツールと比較して大幅な改善を示している。テストにおいて、MultiCubeは、露出したシリンダーを持つ6連発のリボルバー、複数の頭を持つ威厳のあるイーグル・モンスター、あるいは特定の肢を持つメカニカルなロボットといった複雑なオブジェクトを、ユーザーの空間的な指示に厳密に従って生成することができた。他のシステムと比較して、MultiCubeは意図したレイアウトに対してより正確であり、パーツの重複や欠落といったエラーが少なかった。また、このシステムは変更にも柔軟に対応できる。例えば、クリーチャーの脚を翼に置き換えたり、尻尾を長くしたりする場合、ユーザーは残りの構造を維持したまま、新しいパーツを用いてオブジェクトを再生成することができる。

静的なオブジェクトを超えて、この技術はよりダイナミックな応用への扉を開く。MultiCubeはオブジェクトをラベル付けされた個別のパーツとして生成するため、これらのパーツはすぐにアニメーションに使用できる。MultiCubeで作成されたキャラクターは、アーティストが関節の曲がり方や回転を定義するために行う通常の手間のかかる「リギング」作業を必要とせずに、腕や脚を独立して動かすことができる。研究者たちはまた、このシステムが完全に自動化可能であることも実証した。大規模言語モデル(LLM)と接続することで、ユーザーは単に「居心地の良い寝室」といった記述を入力するだけで、システムが自動的に必要なパーツ(ベッド、ナイトスタンド、ランプなど)を特定し、手動でボックスを描くことなく論理的なレイアウトに配置することができる。

このシステムは強力ではあるものの、研究者たちはそれが完璧ではないことも認めている。例えば、パーツを定義するボックスが、車輪を頭の中に配置するなど、物理的に不合理な方法で描かれた場合、生成されるオブジェクトは奇妙なものになる。さらに、パーツがわずかに重なり合う現象が稀に発生することもある。こうした細かな制限はあるものの、この研究は、3D制作をより身近で制御可能なものにするための大きな一歩を象徴している。ユーザーに、オブジェクトがどのように見えるかだけでなく、それがどのように構築され、そのパーツがどこにあるのかを決定する能力を与えることで、MultiCubeは人工知能を、プロのアーティストが求めるレベルのコントロールへと近づけ、単純なテキストとラフスケッチを、複雑で実用的な3Dアセットへと変貌させている。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →