UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models
UniWorld-Viewは、明示的なオクルージョン(遮蔽)を考慮した3Dガイダンスとビデオ拡散モデルを組み合わせることで、疎な単眼入力から高忠実度で幾何学的に一貫した、精密に制御可能な大基線新規視点合成を実現する統一フレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
スマートフォンの片手持ちで、リビングルームを歩き回りながら短い動画を撮っているところを想像してみてください。次に、その動画を瞬時に全く異なるアングルへとテレポートさせる魔法のようなトリックを想像してください。例えば、天井付近に浮遊したり、一度も撮影していない窓越しに部屋を覗き込んだりするように、新しい場所から完璧な鮮明さで部屋を見るのです。これは「新規視点合成(novel view synthesis)」という、コンピュータに平面的な2D画像から3D空間を理解させる方法を教えようとしているコンピュータサイエンスの分野における夢です。長い間、コンピュータはこの分野が非常に苦手としてきました。もし写真の中の椅子の後ろに何があるかを推測するよう求められたとしても、コンピュータはしばしば間違った推測をし、奇妙に引き伸ばされた塊や、透明な穴を作り出してしまいました。彼らはあらゆる角度から撮影された数百枚の写真(これは退屈で困難な作業です)を必要とするか、あるいは欠落した部分を「幻覚」で見せようとしましたが、その結果、壁がゴムのように曲がるような幾図学的な悪夢を招くことがよくありました。しかし、もし幾何学の厳格なルール(壁を真っ直ぐに保つため)と、現代のAIの創造的な力(欠落した部分をリアルに見せるため)の両方の良いところを組み合わせることができたらどうでしょう? それこそが、バーチャルリアリティ、ゲーミング、そしてソーシャルメディアを真に没入感のあるものにするために、研究者たちが取り組んでいる大きな問いなのです。
ここで、北京大学とRabbitpre AIの研究者によって開発された、これらの3D映画の超スマートなディレクターとして機能する新しい手法、「UniWorld-View」が登場します。彼らが解決した核心的な問題は、撮影した角度とは「非常に異なる」角度からシーンを見ようとしたときに何が起こるか、ということです。これは、ある街の角から一度しか見たことがない街の地図を描こうとしているようなものです。建物の向辺に何があるかを推測しようとして、誤って建物の正面のドアを裏側の壁に描いてしまったり、木を空に向かって引き伸ばしてしまったりするかもしれません。従来のAI手法は、シーンのどの部分が隠れている(オクルージョン)のか、どの部分が見えているのかを判別できなかったため、こうした「引き裂き」のミスを犯すことがよくありました。
UniWorld-Viewは、巧妙な2ステップの戦略によってこれを修正します。まず、ビデオから大まかな3D「ポイントクラウド(シーンを表す点のデジタルな雲)」を構築します。しかし、単にこれらの点を新しい画面に投影するのではなく、「トリプル・リプロジェクション(三重投影)」というトリックを使用します。影の写真を撮り、次にその影の反射の写真を撮り、最後にその両方を比較することで、物体の後ろに正確に何が隠れているかを判断することを想像してみてください。これにより、AIはどのピクセルが本物で、どのピクセルが単なる空っぽの穴であるかを正確に伝える完璧な「マスク」を作成できます。また、表面がどの方向を向いているか(法線)をチェックすることで、壁の裏側を誤って表示してしまうことがないようにします。
AIが、そこに「あるべき」ものの幾何学的に正確なマップを手に入れたら、強力な「ビデオ拡散モデル」(ノイズを徐々に鮮明な画像に変えることでビデオを生成するタイプのAI)を使用して、空白を埋めていきます。しかし、ここでの鍵となるのは、AIがただ推測しているのではないということです。それは「デュアルストリーム(二系統)」システムを使用しています。一方のストリームは、カメラがあなたの望む通りに正確に動くことを保証するために幾何学的なマップを注視し、もう一方のストリームは、元のビデオを見てテクスチャと色彩をコピーします。これにより、カメラを新しい場所に移動させたとしても、物体が固形を保ち、照明がリアルに見え、ピクセルのスープのように溶けてしまうことがなくなります。
研究者たちは、AIがカメラの動きをどれだけうまく制御できるか、そして3Dシーンの一貫性をどれだけ維持できるかをテストする厳しいテストである「WorldScore」ベンチマークでこれをテストしました。UniWorld-Viewは、「静止(static)」シーンにおいて最高スコア(85.53)を記録し、ダイナミックなシーンでもトップクラスのモデルを破り、2番目に優れた成績を収めました。また、特定のシーンのために再学習させることなく、単一のビデオから高品質な新しい視点を生成できる(ゼロショット学習)ことも示しました。要するに、UniWorld-Viewは、AIに物理学と幾何学のルールを尊重させつつ、カーテンの裏側を想像するための創造性も持たせることで、たとえ元のビデオが素早い自撮りであっても、自由に周囲を見渡せる、よりリアルな仮想世界への道を切り開いているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。