JoLT: Joint Latent Trajectories for Context-Guided High-Resolution Tiled Generation
JoLTは、低解像度と高解像度の潜在軌道を2つの相互に関連するストリームにおいて同時にデノイズすることで、グローバルなレイアウト制御と微細なディテールの合成を効果的に組み合わせ、豊かで詳細かつ視覚的に美しい画像を生成する、高解像度画像生成のための新しいフレームワークを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
何十年もの間、コンピュータで芸術を生み出すという夢は、単純なトレードオフによって制限されてきました。つまり、明快で一貫性のある画像を得るか、あるいは緻密なディテールに満ちた画像を得るかのどちらかであり、両方を同時に手に入れることは極めて困難でした。書かれた記述から画像を生成するように訓練された現代の人工知能は、全体像を捉えることに関しては驚くほど優れたものになっています。丘の上に城を、あるいはマットの上に猫を配置するといった、完璧な論理に基づいたことが可能です。しかし、アーティストが大きな壁画やファインアートのプリント用として、大規模で高精細な画像を求めたとき、これらのシステムはしばしば苦戦します。遠目には鮮明に見えても、近くで見ると崩れてしまい、シーンに実在感を与えるような高密度で豊かな質感に欠ける傾向があるのです。この問題を解決する標準的な方法は、二段階のプロセスでした。まず、レイアウトを正しく把握するために小さく低解像度の画像を生成し、その上にディテールを付け加えていくという手法です。しかし、このアプローチには根本的な欠陥があります。一度小さな画像が作られてしまうと、コンピュータは新しいディテールを収容するために大きな絵の方を作り直すことができないため、最終的な結果において、微細なテクスチャがシーンの中に織り込まれているのではなく、後から貼り付けられたように感じられてしまうのです。
ある研究チームは、この問題を解決するための異なる方法を提案し、「JoLT(Joint Latent Trajectories:結合潜在軌跡)」と呼ばれる手法を紹介しました。JoLTは、画像を底辺から積み上げるのではなく、小さく始めて大きくしていくのではなく、内部から外へと構築し、大まかな構成と微細なディテールを全く同時に作り上げます。スケッチで大まかな輪郭を描いてから後で塗りつぶすのではなく、山脈の太い筆致を絶えず調整しながら、同時に木の葉一枚一枚を精緻に描き出していく、一連の連続した動きの中でキャンバス全体を描き上げるアーティストを想像してみてください。これが、この新しいアプローチの核心です。このシステムは、互いに絶えず対話する2つの並行したプロセスを実行します。一つのプロセスは全体のレイアウトと構成に焦点を当て、シーンが全体として整合性を保っていることを保証します。もう一つのプロセスは高解像度のディテールに焦点を当て、特定の領域に質感と複雑さを加えます。決定的なのは、これら2つのプロセスは分離されているのではなく、生成のあらゆるステップにおいて情報を共有している点です。レイアウトのプロセスはディテールのプロセスに対して要素を配置する場所を指示し、ディテールのプロセスは進化し続ける豊かさをレイアウトのプロセスへとフィードバックすることで、全体のシーンが新たな複雑さに適応できるようにします。
研究者たちは、強力な画像生成器を用いてこの手法をテストし、既存の最高技術と比較しました。彼らは、ボートや時計、木々で満たされた水没したホテルのアトリウムのような、多くの異なる物体や設定を含む複雑な記述に基づいて画像を生成させました。その結果は驚くべきものでした。JoLTによって生成された画像は、単にサイズが大きいだけでなく、他の手法で作られたものよりも著しく複雑で詳細でした。研究者が画像の情報の密度を測定したところ、JoLTの創造物は膨大な情報の増加を示し、一部の指標では次点の優れた手法に対して50パーセントの向上を記録しました。さらに重要なことに、これらの画像は一貫性を保っていました。追加されたディテールがシーンを壊したり混沌としたものにしたりすることなく、むしろそれらは描かれている世界の自然な一部として感じられました。また、このシステムはユーザーに新しい種類のコントロールをもたらしました。単純な設定を調整するだけで、ユーザーは記述全体を書き直すことなく、最終的な画像の精緻さをどの程度にするかを自在にコントロールできるのです。
これらの改善が実社会の人々にとって意味を持つかどうかを確認するため、研究者たちは、人間がJoLTによる画像と他の主要なシステムによる画像を比較する調査を実施しました。参加者は一貫してJoLTの画像を好み、より詳細で、視覚的に複雑で、芸術的な魅力があると感じました。また、彼らはJoLTの画像が元の記述とも同様に一致していると感じ、これほどのディテールを追加しても正確性が損なわれないことを証明しました。この研究は、高解像度画像の生成に関する従来の見方――小さく始めてそれを拡張しようとする考え方――が、唯一の道ではないことを示唆しています。シーンの創造を、大きな構図と微細なディテールが共に進化する単一の統一されたプロセスとして扱うことで、大規模なスケールと豊かな質感の両立が可能になります。これにより、アーティストやクリエイターにとって、画像を間近で観察しても耐えうるものへと進化させ、コンピュータを単なる単純な絵を作る道具から、高密度で高忠実度な世界を生成できるパートナーへと変える、新たな可能性が開かれます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。