← 最新の論文
💻 computer science

OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields

OmniXは、コンパクトな動的トークンを用いることで動的な動きのモデリングと静的な幾何構造を分離することにより、大きなカメラの動きを伴うビデオに対して高密度な3D点軌跡を予測するフィードフォワード型の4D再構成フレームワークであり、学習用に新たに導入された大規模な合成データセットによってサポートされています。

原著者: Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ビデオゲームで賑やかな都市の広場を再現しようとしている場面を想像してみてください。しかし、手元にあるのは、人々が歩き、車が猛スピードで走り抜け、太陽が空を移動していく様子を捉えた、手ブレの激しい手持ちカメラの映像だけです。カメラは激しく揺れ、ズームし、あちこちへ飛び回ります。これまでの多くの3Dモデル構築の試みは、まるで目隠しをしたままパズルを解こうとするようなものでした。動いている人々を無視して静止させてしまうか、あるいはカメラの動きが激しすぎると混乱してしまい、ぼやけた壊れた映像になってしまうかのどちらかでした。

そこに登場したのが、新しい「フィードフォワード」フレームワーク(いわば、超高速なワンショットのレシピのようなもの)であるOmniXです。これは、動的なシーンを4D(つまり、3Dの形状に加えて、すべての点が時間とともにどのように動くか)で再構成することについに成功しました。たとえカメラがどれほど狂ったように動いていても、です。

魔法のトリック:静止したものと回転するものを分ける

従来のメソッドが失敗したのは、建物の形と人のダンスの動きを、分離せずに同時に理解しようとしたからです。それは、ミキサーを使ってトラックを分離することなく、ドラムソロの最中にバイオリンのソロを聞き取ろうとするようなものです。

OmniXは、この両者を明示的に**デタングリング(分離)**することで解決します(静止したものと動いているものを混ぜない)。これは、背景(静的な幾何学構造)と前景(動的な動き)を異なる材料として扱う手法です。

  • 静的な部分: 壁や地面がどこにあるかを特定します。
  • 動的な部分: すべてのピクセルの動きを個別に追跡する代わりに(これは低速で計算負荷が高い作業です)、OmniXは巧妙なトリックを使います。それは、少数の「動的トークン」を特定することです。これらは、群衆全体の動きをマッピングするために送り出された、数人の精鋭スカウトのようなものです。3Dの動きは本質的に疎(スパース)で組織化されている(低ランクである)ため、これら少数のスカウトが、あらゆる角度、あらゆる瞬間におけるビデオ内のすべてのピクセルの動きを示す「軌跡フィールド」を生成することができます。

「ワンパス」の超能力

古いメソッドは、多くの場合、スローモーションの探偵のように、「この点はどこへ行ったのか?」、次に「次はどこへ行ったのか?」と、フレームごとに何度も確認しながら進む、非常に遅い方法をとっていました。これは「反復的(イテレーティブ)」な手法と呼ばれます。

OmniXは異なります。すべての点の経路を**一度のパス(ワンパス)**で予測します。それは、映画を観ながら、一時停止や巻き戻しをすることなく、登場人物の将来の全経路を瞬時に理解するようなものです。これは、Sparse Spatiotemporal Attention (SSA) と呼ばれる新しいメカニズムによって可能になりました。SSAは最も重要な「動的トークン」を選び出し、それらを時間軸方向に拡張させ、それらがすべての画像データと「対話」することで動きを特定させます。そして、Deformable Trajectory Sampling Head が、これらの疎な手がかりをもとに隙間を埋め、シーン全体に対して高密度でピクセル単位の正確な軌跡を提供します。

トレーニング・ジムの構築:UE5エンジン

ダンスフロアを見たことがないロボットに、ダンスを教えることはできません。著者たちは、このような野心的なモデルを訓練するための、「大きなカメラの動き」と「完璧な3Dラベル」を備えた実世界のデータが不足していることに気づきました。そこで、彼らは独自のジムを構築しました。

Unreal Engine 5 (UE5) を使用して、自動データエンジンを作成しました。静的な環境を用意し、そこに動的なオブジェクト(走行中の車や人々など)を投入し、カスタムカメラシステムを用いて、周囲を激しく振り回しながら撮影を行いました。

  • 結果: 彼らは8万シーンおよび128万本のマルチビュービデオからなる大規模なデータセットを生成しました。
  • アノテーション: すべてのビデオには、正確な深度、カメラのポーズ、および高密度な3D点軌跡という、完璧な「グラウンドトゥルース(正解)」ラベルが付随しています。この合成データこそが、従来のモデルを混乱させてきた180度の激しいカメラの旋回を処理する方法を、OmniXに学習させたのです。

結果:どれほど優れているのか?

論文では、OmniXをいくつかの課題でテストしており、その数値はOmniXがこの分野の新たなリーダーであることを示唆しています。

  • 高密度3D点軌跡: カスタム検証セットにおいて、OmniXは従来の最良の手法(VDPMやTraceAnythingなど)を大幅に上回りました。例えば、「Disjoint Video Pairs」(時間的に重なり合わない2つの別々のビデオクリップ)において、OmniXは全ポイントに対して0.444APD3D(平均点距離)を達成しました(注:この指標では、数値が高いほど性能が良いことを示します)。また、エラー率も大幅に低下し、特定の条件下でOmniXは0.101EPE(終点誤差)を達成しました(VDPMは0.306)。
  • 3D点トラッキング: TAPVid-3Dベンチマークにおいて、OmniXは3つの異なるデータセット(ADT、DriveTrack、PStudio)で最先端(SOTA)の結果を出しました。例えば、ADTデータセットでは、0.367APD3Dに達し、次点のVDPM(0.266)を大きく引き離しました。ここでも、高いAPD3Dは優れた性能を意味します。
  • その他のタスク: ビデオの深度推定やカメラポーズ推定においても非常に優れた成績を収め、KITTISintelといったデータセットでトップクラスの競合他社に匹敵するか、あるいは打ち勝っています。

何が「できない」のか(そして何を否定したのか)

論文は、実験に基づき、何が機能しないのかについても非常に明確に述べています。

  • スカウトのための「自己注意(Self-Attention)」: 彼らは、Sparse Spatiotemporal Attentionモジュールにおいて、動的トークン同士が対話する「自己注意」レイヤーを追加することを試みました。結果はどうだったでしょうか?ほとんど差がありませんでした。論文では、これを不要なものとして明示的に排除し、計算能力を節約できることを示しています。
  • 反復的な推測: 論文は、従来の「点を反復的にクエリする」手法に反対しています。彼らの「ワンパス」アプローチは、高密度な予測においてより高速で正確であることが証明されています。
  • 「小さなカメラの動き」の制限: 高密度な軌跡を予測する従来のメソッドは、カメラがほとんど動かないビデオに限定されていました。OmniXは、大きなカメラの動き(最大180度)や、時間的に分離した入力(時間が重ならないビデオ)に対しても機能することを明確に証明しています。

結論

OmniXは、「何が動いているか」と「何が静止しているか」を分離し、8万シーンの膨大な合成データセットで訓練することで、混沌とした手持ちカメラの映像から、動的な4D世界を単一の効率的なパスで再構成できることを示唆しています。これは単なる小さな改善ではありません。著者たちは、これがすべての点の動きを予測するための新しい**最先端(State-of-the-art)**を確立したことを示しており、自動運転やAR/VRコンテンツ制作などの分野における強力なツールとなることを証明しています。

この論文は、これが宇宙のあらゆる可能性に対して解決済みであると主張しているわけではありませんが、8万のシーンと128万のビデオによる証拠は、大規模で複雑なカメラの動きを扱う上で、これが現在ある中で最も堅牢な手法であることを強く示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →