← 最新の論文
💻 computer science

Bridging Language and Spherical Space: Object-Centric Control for Text-to-Panorama Generation

本論文は、パーサーと制御モジュールを介してテキストを構造化されたオブジェクトレベルの球面条件へと変換することにより、自然言語と球面パノラマ空間を橋渡しするオブジェクト中心のフレームワークであるPanoCtrlを導入し、精密な空間的整合性を備えた最先端の制御可能なテキストからのパノラマ生成を可能にするものである。

原著者: Derui Li, Qian Qiao, Yuhao Sun, Wenhao Guo, Peng Lu

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Derui Li, Qian Qiao, Yuhao Sun, Wenhao Guo, Peng Lu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

部屋の中央に立ち、ゆっくりと円を描くように回転しながら、あらゆる方向の景色を一度に見渡している場面を想像してみてください。これがパノラマ画像の体験であり、単一の点を中心とした全方位360度の世界を捉えるフォーマットです。シーンの一場面を切り取って静止させる標準的な写真とは異なり、パノラマは環境全体を一つの連続したループとして包み込みます。数十年の間、これらの画像を作成するにはカメラと実際の場所が必要でしたが、近年の人工知能の進歩により、コンピュータは単純なテキスト記述からこれらを生成できるようになりました。しかし、重大な障害が依然として残っています。コンピュータは言葉から絵を描くことには長けてきていますが、円状に物がどこにあるべきかを理解することには苦労しているのです。もしコンピュータに「左に椅子、右にランプ」を描くよう頼んでも、人間が円状の空間を説明する方法はコンピュータが平らな画像を処理する方法と一致しないため、コンピュータはそれらを間違った場所に配置したり、指示を完全に無視したりすることがよくあります。

北京郵電大学の研究者たちは、この特定の問題を解決するために「PanoCtrl」と呼ばれる新しいシステムを開発しました。彼らの研究は、私たちが方向を説明するために使う自然言語と、360度画像を作成するために必要な球面幾何学との間の溝を埋めることに焦点を当てています。チームは、標準的な平らな写真にはうまく機能する既存の手法が、パノラマに適用されると失敗することに気づきました。なぜなら、それらは方向が視聴者の周りをどのように回り込むかという独特な仕組みを考慮していないからです。これを修正するために、彼らは画像生成プロセスを単なるピクセルのぼやけた塊としてではなく、球体内の定義された位置とサイズを持つ特定のオブジェクトの集合として扱うフレームワークを作成しました。コンピュータに対し、言及されたオブジェクトが何であり、円の中のどこに属するかをまず正確に特定させることで、それらのアイテムを高い精度で配置するように画像生成を導くことができるのです。

彼らの解決策の核心は、連続して行われる2つの主要なステップで構成されています。第一に、システムはテキストプロンプトを読み取り、それを構造化されたオブジェクトのリストへと分解します。その際、単にそのオブジェクトが何であるかだけでなく、360度の空間における正確な位置とサイズまでも決定します。例えば、テキストに「私の左に窓がある」と書かれていた場合、システムはこれを特定の座標と視野へと変換し、実質的に窓がどこに現れるべきかを示す見えない地図を描き出します。このステップは、曖昧な人間の指示を、コンピュータが従うことができる具体的な空間指示へと変換するために極めて重要です。この地図が作成されると、第二のステップがそれを使用して実際の描画プロセスをガイドします。システムはこれらの指示を画像生成器に直接注入し、コンピュータが絵を構築する際に、窓や椅子やランプを正確にどこに配置すべきかを確実に理解できるようにします。この二段構えのアプローチにより、コンピュータは現実的な部屋の全体的な外観や雰囲気(ルック・アンド・フィール)を維持しながら、テキストによる方向指示に厳格に従うことが可能になります。

この新しいシステムを訓練するために、研究者たちは大規模な新しいデータセットを作成する必要がありました。なぜなら、既存のパノラマ画像のコレクションには、彼らが必要とする詳細なオブジェクトレベルの方向情報が含まれていなかったからです。彼らは「PanoGround」という名前のデータセットを構築しました。これには、数千枚のパノラマ画像と、各オブジェクトが視聴者に対して正確にどこに位置しているかを指定する記述が対になって含まれています。このデータセットは訓練の場として機能し、コンピュータが「前」「後ろ」「左」「右」といった言葉と、球面画像における実際の位置との関係を学習することを可能にします。この特定のデータがなければ、標準的な画像データセットはこのようなレベルの詳細な方向的詳細を提供しないため、システムは球面空間の複雑なルールを学ぶ術を持たないのです。

研究者たちが新しい手法を既存の技術と比較検証したところ、その結果は精度の明確な向上を示しました。実験において、新しいシステムはオブジェクトを正しい方向に配置することに、ほぼ99パーセントの確率で成功しました。これは、しばしば85パーセントを下回る他の主要な手法のパフォーマンスと比較して、大幅な飛躍です。さらに、システムはオブジェクト配置の誤差を大幅に減少させました。つまり、オブジェクトがテキストで示された場所に非常に近い位置に現れるようになったのです。単に場所を正しくするだけでなく、生成された画像はより高品質であり、以前のモデルが生成したものよりも、より現実的で一貫性のあるものとなりました。この研究は、コンピュータに対してオブジェクトとその球面上の位置を明示的に教えることで、ユーザーの指示に真に従うパノラマ画像を作成することが可能であることを証明しており、より没入感のある制御可能な仮想環境への扉を開いています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →