例えば、公園やリビングルームのような現実世界のシーンを、たくさんの2D写真を見るだけで完璧な3Dモデルとして構築したいとしましょう。通常、コンピュータは「魔法の数学」(ニューラルネットワーク)を使用してこれを行いますが、これらは学習には非常に優れていますが、ビデオゲームエンジンやアニメーターが実際に使用する標準的な3Dファイル(メッシュ)を作成することには不得意です。
この論文は、このパズルを解くための新しい方法であるMeshtryoshkaを紹介しています。その名前はロシアのマトリョーシカに由来しており、その手法もまさにその通りに機能します。
コアとなるアイデア:入れ子構造のドール
一つの固形な3Dオブジェクトを作ろうとする代わりに、Meshtryoshkaは、玉ねぎの層やあのロシアの人形のように、互いの内側に重なり合う一連の入れ子状の中空シェルを構築します。
- レイヤー(層): コンピュータは、「空虚な空間」がどこで終わり、「固形物」がどこから始まるかを知っている数学的なマップ(符号付き距離関数と呼ばれます)から始まります。そして、このマップから複数のレイヤーを取り出します。
- レンダリングのトリック: ここが巧妙な点です。通常、コンピュータに3D形状を構築させるように教える際、「画家」(レンダラー)は筆致を感じ取り、「この角をもう少し左に動かす必要がある」と言える必要があります。しかし、標準的で高速な3Dペイントプログラム(ラスタライザ)は、そのようなことができません。それらは「微分不可能」であり、指示された通りに描くだけなのです。
- Meshtryoshkaの解決策: それは、シェルを透明なガラスの層として扱います。各シェルを標準的で高速なペイントプログラムを使用して個別に描き、それらを重ね合わせ、パレットの上で絵具を混ぜるようにブレンドして、最終的な画像を作り出します。
- レイヤーが透明であるため、たとえペイントプログラム自体が角の動かし方を知らなくても、コンピュータは裏側の数学をどのように調整すれば最終的な画像が正しく見えるかを判断できるのです。
なぜこれが大きな意味を持つのか
- 現実の世界に対応している: 従来のメッシュを用いた手法は、小さな物体(おもちゃの車など)しか扱うことができず、背景から切り出すためのマスクを必要としていました。Meshtryoshkaは、この「メッシュ」アプローチを用いて、巨大で境界のない現実世界のシーン(街区全体や森など)を、事前に切り出すことなく扱うことに成功した初めての手法です。
- 標準的なツールを使用している: ほとんどのハイテクな3D再構成手法は、レンダリングのためにカスタムの複雑なソフトウェアを構築する必要があります。Meshtryoshkaは特別です。なぜなら、すでにコンピュータグラフィックスのツールボックスに入っている、既製品の標準的なグラフィックスツールを使用しているからです。これは、優れた結果を得るために「魔法」のようなカスタムレンダラーは必要ではなく、既存のツールを賢い方法で使う必要があることを証明しています。
- 結果: 最終的な出力は、クリーンで標準的な3Dメッシュです。つまり、面倒な「後処理」のステップを踏むことなく、ビデオゲーム、映画、またはVRですぐに使用できることを意味します。
大きな空間を扱う方法
膨大なメモリを消費せずに大規模なシーンを扱うために、この手法はいくつかのスマートなトリックを使用しています。
- スパース性(疎性): 実際に何かが見える場所にのみデータを保存し、空中の空間は無視します。
- 「フラスタム(錐台)」のトリック: 背景(遠くのもの)については、グリッドを伸ばします。道路の写真を撮る場面を想像してください。道路は近くでは広く見え、遠くでは狭く見えます。Meshtryoshkaは、このデータグリッドを伸ばすことで、カメラに近い場所にはより多くの詳細を、遠くにはより少ない詳細を配置し、膨大なコンピュータメモリを節約します。
まとめ
著者らは、標準的な3Dメッシュと標準的なレンダリングソフトウェアを使用して、現実世界のシーンの高精度でリアルな3D再構成が可能であることを示しました。彼らは、高速で微分不可能なツールを使用しながらも、3D形状を学習し改善できるように、問題を「入れ子構造のドール」戦略で包み込むことでこれを実現しました。
言及されている制限事項:
論文では、結果は素晴らしいものの、トレーニングには強力なGPUで約4時間を要すること(新しい非メッシュ手法よりも遅い)が述べられています。また、カメラがほとんど見ていない非常に疎な領域では、他の現代的な3D再構成技術と同様に、薄い浮遊物のようなアーティファクトが発生することがあります。
問題提起
微分可能レンダリングは、3D再構成および新規視点合成の要となっているが、最先端の手法は主に非メッシュ表現(例:ニューラルラディアンスフィールド、3D Gaussian Splatting)や特殊な微分可能レンダラーに依存している。3Dサーフェスメッシュは、ポータビリティ、ハードウェア加速、およびダウンストリームのグラフィックスワークフローにおいて業界標準であるが、既存の微分可能メッシュレンダリング技術は、主にオブジェクト中心のシーンに限定されている。それらは前景・背景のマスクを必要としたり、境界のない実世界の環境に苦戦したりすることが多く、通常、標準的なラスタライザの非微分性を扱うために、カスタムCUDA実装や確率的勾配推定に依存している。その結果、実世界のシーンに対してフォトリアルな結果を達成しつつ、従来のグラフィックスツールを用いてメッシュ表現を直接最適化できる手法は、現時点では存在しない。
手法:Meshtryoshka
著者らは、オフザシェルフの非微分的な三角形ラスタライザを用いて、境界のない実世界のシーンの3Dメッシュ表現を最適化する微分可能レンダリングフレームワークであるMeshtryoshkaを提案する。核心となる革新は、頂点位置の最適化とラスタライゼーションのプロセスを切り離したことにある。
シーンのパラメータ化とメッシュ抽出:
シーンは、符号付き距離関数(SDF)の値と、視点依存の色(view-dependent color)のための球面調和関数係数の疎なグリッドによって表現される。各最適化ステップにおいて、本手法は微分可能なMarching Cubesアルゴリズムを用いて、SDFから複数のレベルセット(等値面)を抽出する。これにより、入れ子状で互いに交差しない三角形メッシュのシェルからなる「マトリョーシカ」が生成される。これらのシェル内の各頂点には、Marching Cubesのプロセスから導出された補間重みを通じて、符号付き距離値と球面調和関数の係数が割り当てられる。
非微分可能ラスタライゼーションと遅延レンダリング:
カスタムの微分可能レイトレーサーを実装する代わりに、本手法は各メッシュシェルを標準的な非微分的ラスタライザを用いて独立してラスタライズする。ラスタライザは、ピクセルごとの三角形IDと重心座標を出力する。これらは、画像空間における頂点ごとのSDF値と球面調和関数の微分可能な補間を行うために使用され、事実上のフラグメントシェーダーとして機能する。
ボリュームレンダリングを近似するために、本手法は各シェルに特定の透過率(Ti)を割り当てる。最も内側のシェルは、ほぼゼロの透過率(不透明)に設定され、後続のシェルをすべて遮蔽することを保証する。最終的な画像は、レンダリングされたシェルをアルファ合成することで構築される。勾配は、アルファ合成プロセスと補間ステップを経由してレンダリング誤差から逆伝播し、基礎となるSDFとカラーパラメータを間接的に更新することで、メッシュジオメトリを最適化する。
境界のないシーンへのスケーラビリティ:
実世界の境界のないシーンを扱うため、著者らは以下の戦略を採用している。
- スパース性: 疎なMarching Cubes実装を使用し、アクティブなボクセルとヘルパーボクセルに対してのみパラメータを格納することで、高密度グリッドと比較してメモリ使用量を劇的に削減している。
- 粗から密への最適化(Coarse-to-Fine Optimization): グリッドは低解像度で初期化され、段階的に細分化されることで、空の空間を刈り取り、必要な箇所のみジオメトリを精緻化する。
- 非立方体グリッド: シーンは前景(軸に整列した立方体)と背景に分割される。背景は、指数関数的にスケールされた頂点を持つ6つの切断錐台を用いてモデル化される。これにより、Marching Cubesに適したボクセルのアスペクト比を維持しつつ、遠方の領域にはパラメータを少なく配置するという効率的なリソース配分が可能になる。
- 正則化:
最適化を安定させるため、本手法は(チェッカーボードアーティファクトを引き起こす可能性のあるEikonal損失ではなく)SDF値に対するラプラシアン平滑化損失と、未観測領域におけるスパース性を促すL1ペナルティを採用している。さらに、モデルが特定の視点に適合するためにジオメトリを「欺く」ことを防ぐため、非DC成分の球面調和関数の学習率を下げている。
主な貢献
- 新しいフレームワーク: Meshtryoshkaは、前景マスクを必要とせずに、境界のない実世界の3Dシーンを再構成できる初の微分可能メッシュレンダリング手法である。
- 標準ツールとの互換性: 本手法は、カスタムの微分可能レンダラーや確率的勾配推定器を必要とせず、オフザシェルフの非微分的ラスタライザを使用して高品質な微分可能レンダリングが可能であることを示している。
- 高性能な実装: 著者らは、疎なMarching Cubesアルゴリズムや、同時に1億個以上の三角形をレンダリング可能なソフトウェア三角形ラスタライザを含む、最適化されたグラフィックスアルゴリズムの実装を提供している。
- 直接的なメッシュ最適化: ボリューム表現から事後的にメッシュを抽出する手法とは異なり、Meshtryoshkaはメッシュ表現を直接最適化するため、最適化段階の品質が最終的なメッシュレンダリングの品質と一致することを保証する。
結果
本手法は、NeRF-Synthetic(オブジェクト中心)およびMip-NeRF 360(実世界)のデータセットで評価された。
- オブジェクト中心のシーン: NeRF-Syntheticにおいて、MeshtryoshkaはNeuS2のような最先端の微分可能サーフェスレンダリング手法と同等の性能を示し、可視性マスクを必要としない点で従来のメッシュベースの手法(DMTet/FlexiCubesを用いたnvdiffrec)を上回った。
- 実世界のシーン: Mip-NeRF 360において、本手法は自転車のスポークや木の葉などの微細なディテールを捉え、高品質で挑戦的な境界のないシーンの再構成に成功した。定量的指標(PSNR)ではZip-NeRFや3D Gaussian Splattingといったトップティアの非メッシュ手法にわずかに及ばないものの、これらの設定で一貫した再構成を行うことができなかった従来のメッシュベースのアプローチを大幅に上回っている。
- アブレーション研究: 実験により、高品質な結果を得るためには、指数関数的な頂点配置、スパース性、正則化、および複数のシェルの使用が不可欠であることが確認された。
意義と主張
本論文は、Meshtryoshkaが微分可能レンダリングへの新たな道を示唆していると論じている。すなわち、特殊な微分可能レンダラーや非メッシュプリミティブに頼るのではなく、従来のコンピュータグラフィックスのレンダリングスタック(標準的なラスタライザとメッシュ表現)に完全に依存することで、競争力のある3D再構成と新規視点合成を実現できる可能性があるということである。著者らは、自らの研究がメッシュのポータビリティと現代的な微分可能レンダリングの性能との間の溝を埋め、実世界のシーンに対してメッシュを直接最適化することを可能にすると主張している。ただし、著者らは限界についても謙虚であり、現在の手法はプリミティブベースのアプローチよりも多くの三角形を生成すること、訓練時間が高速なNeRF/Gaussian手法よりも遅いこと、そして観測が乏しい領域で時として「フローター(浮遊物)」のアーティファクトが発生することを認めている。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録