← 最新の論文
💻 computer science

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

本論文は、新たに作成された100万サンプル規模のデータセットと幾何学を考慮した事前学習技術を活用することで、多様なインコンテキスト・パノラマ生成タスクにおいて、優れた幾何学的整合性とグローバルな一貫性を確保しつつ、最先端の性能を達成する2段階のフレームワークであるCanvas360を紹介するものである。

原著者: Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi

公開日 2026-07-10
📖 1 分で読めます☕ さくっと読める

原著者: Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

完璧な360度パノラマを平らな紙の上に描こうとしている場面を想像してみてください。問題は?平らな地図を球体に巻き付けると、上部と下部が、まるで変な形に溶けたチーズピザのように押しつぶされたり引き伸ばされたりしてしまうことです。ほとんどのAI画像生成器は、「キューブマップ」や3Dのトリックを使ってこれを修正しようとしますが、この論文の著者たち(Canvas360)は、それらの手法でも依然としてジオメトリ(幾何学的構造)が少し不自然に見えてしまうと指摘しています。彼らは、もし真にシームレスで歪みのないパノラマの世界を実現したいのであれば、単に画像を見るだけでは不十分であり、空間の「奥行き」と「形状」そのものを理解する必要があると主張しています。

では、彼らはどのようにしてこれを解決したのでしょうか?彼らは、マスター建築家、そして多才な画家として機能する、2段階のトレーニングパイプラインを構築しました。

ステージ1:ジオメトリ・ブートキャンプ
まず、チームはAIモデルに、2Dではなく3Dの世界を見る方法を教えました。単に画像を見せるだけでなく、すべての画像に深度マップ(あらゆる物体がどれくらい離れているかを示す設計図)をペアリングしました。彼らは、これら一対のサンプルを10万件モデルに投入しました。

モデルが画像と設計図を混同しないようにするために、彼らは巧妙なトリックを使いました。深度マップに「位置オフセット」を与えたのです。これは、劇場の座席番号を割り当てるようなもので、隣にある画像と同じものではないことをモデルに認識させるためです。また、「類似性損失(similarity loss)」と呼ばれる特別なルールも導入しました。これは、画像と深度マップが似すぎてしまった場合にモデルを叱責する仕組みで、両者が明確に区別されるように強制するものです。

最も素晴らしい部分は、**速度円環パディング(velocity circular padding)**を導入したことです。ビデオゲームの世界で、画面の右端から外に出ると、瞬時に左端から現れる様子を想像してください。著者たちは、パノラマの左端と右端が、球体の上では実際には隣り合わせであることをAIに理解させました。単に端の部分をコピー&ペーストしたのではなく、「速度(変化の方向)」が反対側へと完璧に流れるように学習させたのです。これにより、モデルは継ぎ目を不可視に保つ方法を学びました。

ステージ2:多才な画家
モデルがジオメトリを理解した後、彼らは第2段階として、**インコンテキスト生成(in-context generation)**の達人になるよう教えました。これは、AIが既存の画像とテキストプロンプトを用いて、深度マップを必要とせずにあらゆる魔法のような操作ができるようになることを意味します。彼らは、Canvas360Datasetと呼ばれる、100万件の高品質なサンプルを含む大規模な新しいデータセットを用いてトレーニングを行いました。

このデータセットは、以下の4つの特定のタスクをカバーする90万件の新しい合成例によって構築されました。

  • スタイル転送(Style Transfer):写真を鉛筆画や絵画に変える(20万件のサンプル)。
  • アウトペインティング(Outpainting):元の境界線の外側へと視野を広げる(25万件のサンプル)。
  • インペインティング(Inpainting):画像内の欠けている穴を埋める(25万件のサンプル)。
  • 編集(Editing):物体(ソファなど)を取り除いたり、新しい物体を追加したりする(20万件のサンプル)。

著者たちは、これらのタスクごとに個別のモデルを訓練したり、古い「キューブマップ」の手法に頼ったりする必要があるという考えに対し、明確に反論しています。代わりに、ジオメトリに基づいて事前学習された単一の統合されたモデルこそが、これらすべての仕事をより上手くこなせると提案しています。

結果はどうだったのか?
結果は強力な改善を示唆しています。テストにおいて、モデルはFAED(パノラマがジオメトリに対してどれほど忠実であるかを測定する指標)という特定の指標で最高スコアを記録し、他の品質チェックでも非常に優れた性能を発揮しました。71人の被験者が10枚の画像を見たユーザー調査において、Canvas360は、最もシームレスな境界線と最高の全体的品質を持つものとして支持されました。

著者らは、従来の手法ではパノラマを編集する際にエッジがぼやけたり物体が歪んだりすることが多かったのに対し、Canvas360は3D構造を維持できたと述べています。彼らは宇宙のあらゆる問題を解決したと主張しているわけではありませんが、実験結果は、最初から世界の球状の形状を尊重するようにAIを教えることで、より一貫性があり現実的なパノラマ画像を生成するツールを作り出せたことを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →