← 最新の論文
💻 computer science

MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion

本論文では、都市メッシュモデルを幾何学的事前知識として活用し、クロスビュー一貫性モジュールを備えた多段階画像拡散パイプラインを用いることで、仮想ナビゲーションおよび自動運転のための高品質でスタイルの一貫した屋外シーンを生成する新しいフレームワークであるMeSSを提案する。

原著者: Xuyang Chen, Zhijun Zhai, Kaixuan Zhou, Zengmao Wang, Jianan He, Dong Wang, Yanfeng Zhang, mingwei Sun, Rüdiger Westermann, Konrad Schindler, Liqiu Meng

公開日 2026-08-05
📖 1 分で読めます☕ さくっと読める

原著者: Xuyang Chen, Zhijun Zhai, Kaixuan Zhou, Zengmao Wang, Jianan He, Dong Wang, Yanfeng Zhang, mingwei Sun, Rüdiger Westermann, Konrad Schindler, Liqiu Meng

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ある実在する都市の完璧で歩行可能なデジタルツインを構築しようとしていると想像してください。あなたには設計図があります。あらゆる建物、道路、樹木の3D形状です。しかし、それらはすべて平坦で退屈なグレーに塗られています。まるで塗装を待っている粘土モデルのように見えます。これが「メッシュモデル」の世界であり、都市モデルとしては一般的になりつつありますが、都市に生命を吹き込むようなリアルな質感(レンガ、ガラス、グラフィティなど)が欠けています。これらのテクスチャがなければ、バーチャルリアリティ・ツアーに使用したり、自動運転車を訓練したりすることはできません。なぜなら、それらのシステムは、単なる形状の集合体としてではなく、世界が実際にどのように見えるかを正確に見る必要があるからです。

これを解決するために、科学者たちは「生成AI」、具体的には「拡散モデル」と呼ばれるタイプのモデルを使用することを試みてきました。これらのモデルを、単純な説明から絵を描くことができる非常に才能のあるアーティストだと考えてください。しかし、このアーティストに街路を歩きながら街全体を描くよう頼むと、彼らはしばしば混乱してしまいます。例えば、あるフレームでは建物の左側にドアを描いているのに、次のフレームでは突然右側にドアを描いたり、前進するにつれて空の色を変えてしまったりすることがあります。これは「ドリフト(漂流)」と呼ばれます。もう一つの大きな問題は、これらのアーティストが設計図を完全に無視してしまうことです。建物が宙に浮いて描かれたり、実際の都市の形状と一致しなかったりします。したがって、目標は、AIアーティストに、リアルに見え、歩行中も一貫性を保ち、建物の3D形状に完璧に沿って描画する方法を教えることです。

そこで登場するのが、Huawei、ミュンヘン工科大学、その他の研究者によって開発された新しい手法であるMeSS(Mesh-Guided Scene Synthesis)です。MeSSを、単に絵を描くだけでなく、実際に歩ける3Dの世界を構築する「非常にスマートな建設作業員」と考えてください。MeSSは、建物の場所を推測する代わりに、都市の「骨格」であるテクスチャのないメッシュモデルから始まり、それを厳格なガイドとして使用します。

MeSSの秘訣は、著者たちが「コントロール・ディストリビューション・マッチ(制御分布一致)」と呼ぶ概念です。あなたがロボットに絵を描く方法を教えていると想像してください。もし、あなたが実在の都市の写真を使ってロボットを訓練すれば、そのロボットは現実のカメラが世界をどのように捉えるかに基づいて描画することを学びます。しかし、もしその後に、コンピュータ生成された3Dモデルに基づいて描画するよう頼んだ場合、コンピュータ生成の「奥行き」や「影」の見え方が異なるため、ロボットは混乱してしまいます。MeSSは、その「ControlNet」(ロボットへの指示書)を、都市のメッシュのコンピュータ生成された奥行きや形状上で直接訓練することで、この問題を解決します。つまり、このロボットは、都市の特定の言語(3D設計図の言語)を読み解くエキスパートなのです。描き始める時、ロボットは推測しません。壁や窓がどこにあるべきかを正確に把握しています。なぜなら、そのロボットは、描画に使用しているデータと全く同じ種類のデータで訓練されているからです。

長い通りを移動しても都市の一貫性を保つために(この「ドリフト」問題を回避するために)、MeSSは巧妙な2ステップのプロセスを使用します。まず、マスターペインターのように、街路の重要なスナップショットである「キーフレーム」の一連の画像を作成します(20メートルごとに作成)。これらは、スタイルが変わらないように、前の絵をリファレンスとして使用しながら一つずつ描かれます。次に、「アピアランス・ガイデッド・インペインティング(外観誘導型インペインティング)」と呼ばれる手法を用いて、これらのスナップショット間の隙間を埋めていきます。例えば、街角のぼやけた写真があるとします。このツールは、写真のぼやけている部分の周囲にある鮮明でクリアな部分を参照し、それを使用してぼやけた箇所を修正することで、テクスチャ(レンガ壁のパターンなど)が完璧に一致するようにします。

最後に、チームは「グローバル・コンシステンシー・アライメント(全域的一貫性調整)」ステップを追加します。優れた計画があっても、ある部分の通りが隣の部分よりも明るかったり暗かったりすることがあります。これは、パーツごとに編集された写真のようなものです。このステップは、映画スタジオのカラーリストのように機能し、それらの差異を滑らかに整え、旅全体がひとつの連続した、シームレスなビデオであるように感じさせます。

結果は目覚ましいものです。200メートルの都市経路を用いたテストにおいて、MeSSは既存の最高の手法と比較して、視覚的な不整合を31%減少させ、生成された画像の全体的な品質を大幅に向上させました。最もエキサイティングなことに、研究者たちは、AIを再学習させることなく、ミュンヘンの実在する都市モデル(LoD3メッシュ)でMeSSをテストしました。システムは、現実の建物のドアや窓と完璧に一致するリアルなファサード(正面)を描き出し、この「メッシュ誘導型」のアプローチが、コンピュータシミュレーションだけでなく、実在の都市でも機能することを証明しました。

要約すると、MeSSは、AIアーティストに適切な設計図を与え、その読み方を教えれば、美しいだけでなく、幾何学的に完璧で一貫性のある仮想都市を構築できることを示しています。これは、より優れたバーチャルツアーや、より安全な自動運転車の訓練への扉を開くものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →