WorldRover: A Scalable Synthetic Video Data Engine for World Exploration with Rich Annotations
本論文は、アーティストが構築した環境における長距離かつ高度にアノテーションされた合成ビデオシーケンスを生成する、Unreal Engine上に構築されたスケーラブルなデータエンジンであるWorldRoverを紹介するものであり、これは一貫した世界の探索および再構成のためのモデル訓練に向けて、同期されたRGB、メトリック深度、カメラの軌跡、および多様な視点データを提供する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
機械が世界をナビゲートする方法を理解するためには、まずその世界を「見る」とはどういうことかを理解しなければなりません。コンピュータが空間を移動するためには、目の前にあるものの画像以上のものが必要となります。物体がどれくらい離れているのか、カメラ自体がどのように動いているのか、そして物体が互いの背後を通り過ぎる際に形がどのように変化するのかを知る必要があるのです。現実の世界では、これらすべての情報を一度に捉えることは非常に困難です。カメラはビデオを記録できますが、木までの正確な距離や、カメラを持っている人物が歩いた正確な経路を自動的に教えてくれるわけではありません。科学者たちはしばしば、事後的にこれらの詳細を推測しなければならず、それらの推測は、特に物体が視界を遮っている場合には間違っていることがあります。完璧な幾何学構造と動きの知識がなければ、コンピュータに、探索して再び戻ってこられるような、安定した一貫性のある場所のメンタルマップ(精神的な地図)を構築させることは困難です。
これは、アライヤ・ラボ(東京大学)、および上海イノベーション研究所の研究チームが、「WorldRover」と呼ばれる新しいシステムによって取り組んだ課題です。彼らは、乱雑な現実世界のビデオから完璧なデータを抽出しようとする代わりに、ゼロからデータを生成するマシンを構築しました。彼らは、アーティストによって作られた仮想環境を取り込み、そこへカメラを長時間、微細なスケールの旅へと送り出すパイプラインを作成しました。この革新的な点は、このシステムが単にビデオを記録するだけでなく、その旅の全履歴を同時に記録することにあります。カメラが移動するにつれて、システムはそれが辿った正確な経路、あらゆる地点への正確な距離、そしてあるピクセルが前のピクセルとどのように関連しているかを捉えます。世界が合成されたものであるため、研究者たちはすべてのフレームの「真実」を知っています。彼らは、カメラがどこにいたのか、光がどのように壁に当たったのか、そして三次元空間内のあらゆる物体がどこに位置しているのかを正確に把握しているのです。
この取り組みの結果として、「WorldRover-10M」と名付けられた膨大なデータコレクションが誕生しました。これには、街路、地下鉄の駅、森林、大聖堂など、32種類の異なる仮想環境から抽出された6,000以上の異なるビデオシーケンスが含まれています。合計で、2,100万フレーム以上のビデオを保持しており、これは200時間を超える映像量に相当します。このコレクションをユニークなものにしているのは、同じ旅を3つの異なる視点から提供している点です。すなわち、世界を歩いているかのような一人称視点、キャラクターの後ろから追従する三人称視点、そして観察者の周囲のすべてを捉える360度のパノラマ視点です。すべてのフレームに対して、システムは一致するラベルのセットを提供します。これらには、シーンの正確な奥行きを示すマップ、カメラがどのように動いたかの記録、そして画像内の点が次の瞬間へとどのようにシフトするかを示す高密度なトラッキングが含まれます。
研究者たちは、特定の課題を解決するためにこのエンジンを設計しました。それは、「視覚的な変化の原因が決して混同されないデータ」の必要性です。通常のビデオでは、ピクセルが動いた理由が、物体が動いたせいなのか、それともカメラが回転したせいなのかを判別するのが困難です。WorldRoverでは、研究者は異なる条件下で全く同じルートを再生することができます。例えば、明るい日光の下での街歩きを見せた後に、濃霧の中での歩行を見せたり、あるいはテクスチャがすべて除去され形状だけが残った中立的な白いモデルとして見せたりすることも可能です。経路と幾何学構造は同一のまま外観だけが変化するため、このデータから学習するコンピュータは、世界の構造と見た目を分離して学習することができます。この分離は、世界を深く理解し、ナビゲートしたり三次元で再構成したりする必要があるモデルを訓練するために不可欠です。
これを構築するために、チームは通常ビデオゲームを作成するために使われるツールである強力なゲームエンジンを使用しましたが、彼らはそれを科学的なデータ生成のために転用しました。彼らは、現実の場所のように細部まで作り込まれ、雑然とした32の異なる環境を用意しました。そして、これらの空間を移動するための3つの異なる方法をプログラムしました。一つの方法は、効率的なルートを計画するために、あらかじめ計算された歩行可能な経路のマップを使用しました。もう一つの方法は、移動中に障害物を感知する反応型のエージェントを使用しており、これは新しい部屋を探索する人間のように、さまよったり行き詰まったりすることがあります。三つ目の方法は、人間が手動で経路を記録することを可能にしました。これらのルートはオフラインでレンダリングされました。つまり、コンピュータはリアルタイムの画像を作成するために急ぐのではなく、時間をかけてあらゆる光線や影を高い精度で計算しました。このプロセスにより、時間の経過とともに変化する照明や天候の変化に合わせて、物理的に正確なデータを生成することが可能になりました。
データセットには、異なるタスクに合わせて調整された特定のサブセットが含まれています。三人称のシーケンスは、キャラクターがカメラとは独立して動く様子を示すため、特に価値があります。これにより、研究者は、機械が観察者の動きと世界内の物体の動きをどのように区別できるかを研究することができます。システムはまた、キャラクターと背景上のポイントを、それらが壁や他の物体の後ろに隠れているときでさえ、長期間にわたって追跡します。データは、ある点が目に見えるときにどこにあるかだけでなく、もしそれがまだ見えていたとしたらどこにあるのかという概念、すなわち「アモーダル・トラッキング(非顕在的追跡)」を提供します。これは、建物の後ろにある車が、たとえ見えていなくても、依然として存在し、特定の場所にあることを理解するために極めて重要です。
WorldRover-10Mは単なるビデオのコレクションではなく、あらゆる情報がキャプチャされた正確な瞬間に紐付けられた構造化されたライブラリです。深度マップはメートル単位で測定され、オプティカルフローは正確な単位でピクセルの動きを記録し、カメラの経路は高い忠実度で記録されています。チームはこのデータを、研究者が推測や推定を行うことなく、生の情報を容易にアクセスできる形式で公開しました。彼らはこのデータを一般に公開しており、他の人々が、探索可能な世界を理解し、ナビゲートし、再構成できるモデルを構築するための基礎を提供しています。世界の探索という問題をスケーラブルなデータ生成タスクへと変えることで、研究者たちは人工知能の分野に、現実世界の録画だけでは達成不可能な明晰さと制御力を提供する新しいツールをもたらしました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。