← 最新の論文
🤖 AI

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

NVIDIA OmniDreamsは、Cosmos拡散アーキテクチャに基づき構築されたリアルタイムの基盤生成ワールドモデルであり、クローズドループの自動運転車両のトレーニングおよび評価のために、フォトリアルでアクション条件付きのセンサー観測を自己回帰的に合成することで、従来のシミュレータの汎用性の限界を克服するものです。

原著者: NVIDIA, :, Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jon
公開日 2026-06-03
📖 1 分で読めます☕ さくっと読める

原著者: NVIDIA, :, Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jonathan Lorraine, Jun Gao, Kai He, Katarina Tothova, Kevin Xie, Michał Tyszkiewicz, Qi Wu, Riccardo de Lutio, Ruilong Li, Sanja Fidler, Seung Wook Kim, Tianchang Shen, Tianshi Cao, Tobias Pfaff, William Lew, Xindi Wu, Xuanchi Ren, Yifan Lu, Yuxuan Zhang, Zan Gojcic, Zian Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

全体像:「運転を学ぶ」ビデオゲーム

あなたが自動運転車に世界の進み方を教えているところを想像してみてください。いきなり実際の道路で走らせることはできません。危険だからです。そこで、車が練習するためのシミュレーター、つまり「ビデオゲーム」が必要になります。

長い間、これらのシミュレーターは**「フォトアルバム」**のようなものでした。もし特定のシナリオをテストしたいと思ったら、実際の街の写真を撮り、そこから車を切り抜き、貼り付ける必要がありました。もし雪が降っている様子を見せたければ、最初から雪が写っている写真を探さなければなりませんでした。もし車が、元の写真には写っていない方向へ曲がった場合、シラレーターはバグを起こしたり、映像がぼやけて使い物にならなくなったりしました。それは「過去」に縛られていたのです。

OmniDreamsは違います。これはフォトアルバムではなく、**「魔法のカメラを持ったクリエイティブ・ディレクター」**です。単に古い映像を再生するのではなく、今まさに車が行っている動きに基づいて、世界が次にどう見えるかを「想像」するのです。

仕組み:「イマジネーション・エンジン(想像力エンジン)」

OmniDreamsは「ワールドモデル」です。これは、何百万時間もの運転ビデオを視聴してきた、非常に賢いAIだと考えてください。このAIは、雨がどのように見えるか、歩行者がどのように飛び出してくるか、車の影が曲がる際にどのように変化するかといった、世界の「ルール」を学習しています。

以下は、それがリアルタイムで行うループです:

  1. ドライバー(ポリシー): 自動運転車が左に曲がることを決定します。
  2. ディレクター(OmniDreams): AIはその決定を受け取り、次の数秒間の映像を瞬時に「夢見る(生成する)」ことができます。街並み、雨、そして曲がる動きに反応する周囲の車などのフォトリアルな画像を生成します。
  3. フィードバック: 車はこの新しい映像を見て、次に何をすべきかを判断し、ループが続きます。

動画を「進みながら」生成するため、車は、突然の吹雪や、トラックからマットレスが落下してくる場面など、これまで一度も起きたことのない状況でも練習することができます。

秘訣:いかに速く、リアルであり続けるか

ビデオの生成は通常、映画館で映画を上映する時のように時間がかかるものです。しかし、時速60マイル(約100km/h)で走る車にとって、シミュレーターは現実と同じ速さで動作しなければなりません。

  • 「ストリーミング」のトリック: 今見ているシーンの裏側で、次のシーンが描かれている映画を見ているところを想像してください。OmniDreamsは「メモリキャッシュ(メモ帳のようなもの)」を使用して、直前に描いたものを記憶します。毎回街全体を描き直すのではなく、変化した部分だけを更新します。これにより、現実の車に追いつくのに十分な毎秒68〜105フレームという速度でビデオを生成できます。
  • 「マルチビュー」のマジック: ほとんどのビデオAIは一つのカメラ視点しか作れませんが、OmniDreamsは同時に4つのビュー(前方、左、右、およびズームアップされたビュー)を作成でき、それらはすべて完璧に一致します。もしあなたが左を見たなら、左のカメラには正しい街角が映り、右のカメラには正しい建物が映ります。これらは常に同期しています。

2つの超能力

論文では、この技術が使われる主な2つの方法が強調されています。

1. 究極のテストドライバー(シミュレーション)
OmniDreamsは環境そのものとして機能します。これによって、「ロングテール(稀にしか起こらない事象)」のシナリオ、つまりカメラに捉えるのが難しい、珍しい、奇妙な、あるいは危険なイベントを作り出すことができます。

  • 例え: 通常のシミュレーターが「固定されたコースのある教習所」だとすれば、OmniDreamsは「インストラクターが突然天候をハリケーンに変えたり、道路に牛を落としたり、あるいは全員に対して信号を青に変えたりして、車がどう反応するかを試す教習所」です。

2. ドライバーの脳(ポリシー)
驚くべきことに、ビデオを生成するために使われるのと同じAIの脳が、車を運転するためにも使用できることが示されています。

  • 例え: 通常は、「ディレクター(映画を作る人)」と「スタントドライバー(車を運転する人)」が分かれています。OmniDreamsは、ディレクターがスタントドライバーにもなれることを示しています。OmniDreamsに運転を微調整させたところ、たとえ5倍小さかったとしても、より大規模で複雑なAIよりも優れたパフォーマンスを発揮しました。これは、自分の行動の結果を「想像」することによって、運転を学んだためです。

壊れたシミュレーターの修正

論文では、OmniDreamsが他のシミュレーターを修正できることについても触れています。

  • 例え: 正面からは素晴らしく見えるけれど、横から見るとぼやけて変に見えてしまう街の3Dモデルを想像してください。OmniDreamsは「修正役」として機能できます。ぼやけた3Dモデルを見て、正しい詳細を「幻覚(ハルシネーション)」として描き出し、再びシャープでリアルなものにするのです。これにより、シミュレーションを実質的にクリーンアップできます。

まとめ

OmniDreamsは、自動運転車のためのリアルタイム生成ビデオエンジンです。これは、静的な再生ベースのシミュレーターを、動的で創造的なエンジンへと置き換えます。これにより、エンジニアは極端な天候から予測不可能な歩行者に至るまで、無限に多様なシナリオを、実際の道路に出ることなく、安全にテストできるようになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →