✨ 要約🔬 技術概要
ビデオゲームやロボットシミュレーションのために、リアルな 3D 世界を構築したいと想像してみてください。過去には、AI ツールが 3D 物体を作成できましたが、それらはしばしば滑らかでぼやけた粘土の彫刻のように見えました。鋭いエッジが欠け、異なる照明下で素材がリアルに見えず、物体は「扉」や「車輪」のような可動部品を持たない単なる「固体のブロック」に過ぎませんでした。
Seed3D 2.0 は、これらの問題を解決するために設計された ByteDance の新バージョンです。これを、子供の遊び用粘土キットから、可動する機械も構築できるプロの建築家の 3D プリンターへと進化させるものだと考えてください。
以下に、その仕組みを簡単な部分に分解して説明します。
1. 形状の構築:「ラフドラフト」と「磨き上げ」
古い AI は全体を一度に構築しようとしましたが、その結果、詳細がごちゃごちゃになることがよくありました。Seed3D 2.0 は、彫刻家が段階的に作業するように、2 段階のプロセス を使用します。
ステージ 1(ラフドラフト): AI が物体の基本的な骨格と全体的な形状を素早く構築します。全体像は正確ですが、表面は少し滑らかでぼやけています。
ステージ 2(磨き上げ): AI はそのラフドラフトを取り戻し、微細な高周波数の詳細を追加します。エッジを鋭くし、傷を追加し、曲線を修正します。
秘密の武器: これを高速かつ効率的に行うために、特別な「圧縮ツール」(Locality-Aware VAE)を使用します。スーツケースをパッキングすることを想像してください。すべてのシャツを個別に折りたたむ代わりに、このツールは類似したアイテムを賢くグループ化して、スーツケース(コンピュータのメモリ)を小さく保ちます。しかし、開封すると、服は完璧に整った状態のままです。
2. 表面の塗装:「スマートペインター」
過去には、AI がまず物体に色を塗ってから、別のステップで素材が何か(金属か、プラスチックか?)を推測していました。これにより、光沢のあるプラスチックのおもちゃが濡れた金属のように見えるなどのミスが発生しました。
Seed3D 2.0 のアプローチ: これは統合ペインター を使用します。色(アルベド)と素材の特性(光沢や粗さ)を同時に塗ります。
「スマートアシスタント」: AI が素材が「あるべき姿」を理解するのを助けるため、「スマートアシスタント」(ビジョン・ランゲージモデル)に相談します。「錆びたスチームパンクのロボット」を求めた場合、アシスタントはペインターに、「これは単なる茶色の塗料ではなく、経年劣化した銅や風化した金属のように見える必要がある」と伝えます。これにより、ゴム製のボールが鏡のように見えるなど、物理法則を破るミスを防ぐことができます。
3. 「シミュレーション対応」にする:「レゴビルダー」
これが最大の飛躍です。以前のモデルは、固体で静止した像を作成していました。可動するアームレストを持つ椅子を作りたい場合、古い AI にはできませんでした。Seed3D 2.0 は、物理世界で実際に相互作用 できる物体を作成するための 3 つの新しいツールを導入します。
シーンプランナー: 単一の物体を作るだけでなく、テキスト記述や動画を見て、部屋全体の配置をどのように行うかを判断します。ソファをどこに置くか、テーブルのサイズをどうするか、そして互いに衝突せずにどのように配置するかを決定します。
パーツ分解器: トースターのような固体の物体を見て、どの部分が分離されているか(扉、レバー、ベースなど)を判断します。物体を機能的な「レゴブロック」に分解します。
「蝶番」メーカー: 部品が分離された後、AI はそれらがどのように動くかを判断します。「この扉は蝶番で開閉するのか?この車輪は回転するのか?」と問いかけます。その後、物体が物理エンジン内で正しく動作するように、目に見えない継手と制限(扉が開く最大角度など)を構築します。
4. 結果
チームは、Seed3D 2.0 を他の 5 つのトップ商用 AI モデルと比較してテストしました。人間の専門家に、一対の 3D 物体から最も優れたものを選んでもらいました。
結果: Seed3D 2.0 はほぼ毎回勝利しました。完全にテクスチャが施された 3D 物体の作成に関するテストでは、競合他社に対して**69% から 90%**の割合で好まれました。
その重要性: 作成された物体は単に美しい画像ではなく、「シミュレーション対応」です。つまり、ロボット工学のトレーニング、バーチャルリアリティ、3D プリントなど、物体が現実世界の物体と完全に同じように振る舞う必要がある分野で使用できるほど正確です。
要約: Seed3D 2.0 は、過去の汚く、ぼやけ、静止した 3D 物体を取り、複雑な現実世界のアプリケーションで使用可能な、鮮明でリアルで、インタラクティブなアセットへと変えます。
技術概要:Seed3D 2.0
問題定義
Seed3D 1.0 はシミュレーション対応の 3D アセット生成の基盤を確立しましたが、XR、ロボティクス、3D プリントといった高忠実度の生産環境における展開を妨げる 2 つの重要なギャップが存在しました:
品質ギャップ : Seed3D 1.0 を含む既存のモデルは、鋭いエッジを持つ幾何学的に規則的な形状や、変化する照明下で一貫性を保つ物理ベースの材質(PBR)の生成に苦慮しています。単一ステージの生成パイプラインは、大域構造の学習と高周波詳細の復元とのバランスを取ることがよく失敗します。
機能ギャップ : 下流アプリケーションは、一貫性のある複数オブジェクトのシーン、機能的に分解されたオブジェクト、および部品レベルの物理的相互作用をサポートするアセットをますます必要としています。Seed3D 1.0 は、部品レベルの分解や可動性機能を持たない、静的で包括的なメッシュに限定されていました。
手法
Seed3D 2.0 は、厳密なデータパイプラインに支えられ、幾何学、テクスチャ、シミュレーション対応機能にわたる包括的なシステムアップグレードを通じて、これらのギャップに対処します。
1. 幾何学生成
システムは、大域構造の学習と高周波詳細の復元を分離するために、粗から細への 2 ステージパイプライン を採用します:
Seed3D-VAE : 局所性認識型の変分オートエンコーダは、連続的な 3D 幾何学をコンパクトな VecSet 表現に圧縮します。幾何学的に複雑な領域に表現容量を集中させる局所性認識潜在集約 と、再構成忠実度を維持しながらデコード遅延を削減するコンテンツ適応型スパースルーティング機構 を利用します。
Seed3D-DiT : 修正フローベースの拡散トランスフォーマーは 2 つのステージで動作します:
ステージ 1(粗構造) : 画像条件付けから幾何学的基盤を生成し、大域トポロジーを確立します。
ステージ 2(詳細精製) : ステージ 1 の出力を精製して高周波詳細を復元します。このステージは、部分的に拡散されたステージ 1 潜在変数である粗形状事前分布 と、粗幾何学から導出されたボクセル化位置符号化 によって正則化され、構造的規則性と鋭いエッジの復元を確保します。
2. テクスチャと材質生成
Seed3D 2.0 は、その前身のカスケード型パイプラインを統合 PBR モデル に置き換えます:
直接生成 : モデルは、参照画像と 3D 幾何学からマルチビューのアルベド およびメタリック・ラフネス(MR)マップ を直接生成し、マルチビュー RGB 合成からの中間誤差蓄積を排除します。
エキスパート混合(MoE) : MoE 構造により、計算オーバーヘッドを比例して増やすことなく、高解像度生成と豊かな視覚パターン(テキストや微細なテクスチャを含む)が可能になります。
VLM ベースの条件付け : 未知の照明下での材質推定の不適切な問題を解決するため、ビジョン・ランゲージモデル(VLM)が材質タイプや表面特性などの意味事前分布を条件付けトークンとして提供し、生成を安定させ、物理的な妥当性を向上させます。
3. シミュレーション対応生成モデルスイート
静的生成と対話型シミュレーションの間のギャップを埋めるため、Seed3D 2.0 は 3 つのトレーニング不要または微調整済みモジュールを導入します:
シーンレイアウト計画 : テキスト、画像、または動画入力から空間的に一貫したオブジェクトレイアウトを推論します。視覚入力の場合、深度推定と VLM を活用して大域構造を復元します。テキスト入力の場合、微調整された LLM が空間推論を処理し、オブジェクト記述とレイアウトを生成します。
部品レベル生成 : Seed3D-PartSeg (表面セグメンテーション用)とSeed3D-PartDiT (部品認識再構成用)を用いた「認識後生成」パイプラインにより、アセットを機能的に意味のあるコンポーネント(例:ドア、取っ手)に分解します。
可動アセット生成 : VLM からの意味事前分布、分解されたメッシュからの幾何学的事前分布、および画像から動画生成モデルからの動的事前分布を組み合わせることで、運動学的構造(関節タイプ、軸、運動範囲)を推論します。出力は物理エンジン用の標準形式(例:URDF)にエクスポートされます。
4. データとトレーニング
データパイプライン : 6 ステージの前処理フレームワークがデータ品質を確保します。これには、フォーマットの正規化、カテゴリ固有の視覚的重複排除、VLM によるスコアリング/キャプション付け、アセットの選定、L ∞ L_\infty L ∞ に着想を得た定式化を用いたシャープネス保持のウォータータイトなリメッシュ、および条件レンダリングが含まれます。
トレーニング戦略 :
幾何学 : 事前トレーニング(PT)、解像度を上げながらの継続トレーニング(CT)、および教師あり微調整(SFT)を含む階層的漸進パイプライン。ステージ 2 は特に、ボクセル化符号化による正則化を組み込みます。
テクスチャ : MoE ベースの PBR モデルを多様なデータで事前トレーニングし、その後、複雑な照明下での材質推定を精緻化するために VLM 生成の材質記述を用いて SFT を行う 2 ステージ戦略。
推論効率 : 推論コストを削減するために漸進的蒸留パイプライン が採用されます。まずクラスラフリーガイド(CFG)機構を蒸留し、その後、視覚忠実度と一貫性を維持しながらサンプリングステップを反復的に半分に減らす漸進的ステップ蒸留を適用します。
主な貢献
強化された幾何学 : 局所性認識型 VAE を備えた 2 ステージ DiT パイプラインは、単一ステージアプローチと比較して、優れた幾何学的シャープさと構造的精度を達成します。
統合 PBR テクスチャ : MoE スケーリングと VLM 条件付けを備えた統合モデルは、高解像度テクスチャ、正確な材質境界、および改善されたテキストレンダリング忠実度を提供します。
シミュレーション対応機能 : シーンレイアウト計画、部品認識分解、トレーニング不要の可動生成の導入により、一貫したシーン構築と部品レベルの物理的相互作用が可能になります。
生産スケーラビリティ : 漸進的蒸留戦略は、品質を維持しながら推論コストを大幅に削減し、生産規模での展開を容易にします。
結果
大規模な人間評価研究において、Seed3D 2.0 は 5 つの最近の商用モデル(Hunyuan3D-2.5、Hunyuan3D-3.1、Tripo 3.0、Rodin Gen2 v1.9、HiTem v2.0)と比較されました:
形状のみの生成 : Seed3D 2.0 は、Hunyuan3D-3.1 対で55.2% 、Seed3D 1.0 対で**98.3%**の勝率を達成しました。
エンドツーエンドのテクスチャ付きアセット生成 : Seed3D 2.0 は、すべてのベースラインに対して**69.0%から 89.9%**の一貫した勝率を達成しました。 定性的比較により、Seed3D 2.0 は鋭い構造的詳細を備えた高精度の幾何学を生成し、信頼性の高いテキストレンダリングを含む優れたテクスチャ分解を実現することが確認されました。
意義
Seed3D 2.0 は、静的アセット作成を超えて生産グレードのシミュレーション対応出力 へと進む、3D コンテンツ生成における体系的な進歩を表しています。品質と機能のギャップを埋めることで、このシステムは XR、ロボティクス、および具現化 AI における実世界展開要件と生成 3D モデリングの間の隔たりを埋めます。意味条件付け、部品レベルの分解、および可動推論の統合は、対話的で物理的に妥当な 3D 環境を構築するための統一基盤を提供します。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×