← 最新の論文
💻 computer science

Through Van Gogh's Eyes: Global Style Transfer with Diffusion Mod

本論文は、グローバル・スタイル・ガイダンスとコンテンツ・アライメント・ガイダンスを活用することで、対象となるアーティストの複数の作品を単一のコンテンツ画像へと集約し、それによって、意味構造の保持とテキストに起因するバイアスの低減を実現しつつ、既存手法におけるアーティストのグローバルなスタイル分布の捕捉に関する限界を克服する、新たな芸術的画像合成パラダイムであるGlobal Style Transfer (GST) を提案する。

原著者: Jeongha Lee, Yujin Kim, Ghazanfar Ali, Suhyun Kim, Jae-In Hwang

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Jeongha Lee, Yujin Kim, Ghazanfar Ali, Suhyun Kim, Jae-In Hwang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、デジタルキャンバスが並ぶ部屋に足を踏み入れたばかりの、タイムトラベル中の美術批評家であると想像してください。あなたはこう問いかけたいのです。「もしゴッホのような有名な画家が今日生きていたら、現代の街並みや、フェンスの上に座る猫をどのように描くだろうか?」と。これこそが「芸術的画像合成(artistic image synthesis)」の核心であり、コンピュータが人間の芸術家特有の視覚的な指紋を模倣しようとする分野です。長い間、コンピュータにはこれを行うための主に2つの方法がありました。1つ目は、厳格なコピー機のようなものでした。それは特定の1枚の絵画を取り上げ、新しい写真をその絵と全く同じに見えるよう強制しますが、その結果、芸術家のキャリア全体という大きな視点を見落としがちでした。2つ目の方法は、ロボットに対して言葉だけを使って「ゴッホのスタイルで描いて」と頼むようなものでした。この方法は柔軟ではあるものの、ロボットが何度も何度も、最も有名で象徴的な絵画(『星月夜』など)に過度に依存してしまう傾向があり、その芸術家の多様な作品の他の部分を無視してしまいました。科学者たちが答えようとしている大きな問いは、「いかにして、単に一つの有名な絵をコピーしたり、コンピュータを欺く可能性のあるテキストプロンプトに頼ったりすることなく、芸術家の『魂のすべて』、つまり彼らのスタイルの全範囲、色彩、そして筆致をコンピュータに理解させるか」ということです。

この論文は、「グローバル・スタイル・トランスファー(GST)」と呼ばれる巧妙な新しい解決策を紹介しています。これは、筆を取る前に、芸術家の作品のライブラリ全体を研究する熟練の美術学生のようなものです。単一の絵画を見たり、テキストによるコマンドを聞いたりする代わりに、研究者たちのシステムは、一人の芸術家(ゴッホ、モネ、あるいはルノワールなど)から数百の芸術作品を集め、それらを一つに結びつける「グローバル・スタイル」を学習します。彼らはこれを、多くのソースとなる絵画から、単一の新しい画像のための統一されたスタイルガイドへと融合させるため、「Many-to-One(多対一)」のアプローチと呼んでいます。

これを実現するために、チームは2つの特別なツールを構築しました。1つ目は、「グローバル・スタイル・ガイダンス(GSG)」です。これは、コンピュータの脳内に存在する秘密のデコーダーリング(解読リング)だと考えてください。このツールは、言葉で「ゴッホであれ」と指示する代わりに、数百の絵画の中にある視覚的なパターンを観察し、「スタイル・オフセット」を計算します。これは、コンピュータに対し、芸術家の真の、広範な個性に一致するように、どのように色や質感を変容させるべきかを伝える数学的な「押し(nudge)」となります。決定的なことに、研究者たちは、このツールを「A painting(一枚の絵)」という退屈で固定されたフレーズで訓練することで、テキストの影響を取り除き、コンピュータからテキストの影響を排除できることを発見しました。つまり、コンピュータは、テキストに関連付けられた最も有名な作品をコピーするというバイアスを避け、純粋に「見たもの」から学習するのです。

2つ目のツールは、「コンテンツ・アライメント・ガイダンス(CAG)」です。あなたがゴッホのスタイルで友人の肖像画を描いている場面を想像してください。あなたは渦巻くような厚塗りの筆致を求めていますが、同時に、それがランダムな他人ではなく、依然としてあなたの友人に見えるようにしたいはずです。CAGは、芸術家のスタイルによって画像の他の部分が歪んだり変化したりしても、友人の顔をその場に留めておくためのセーフティネットです。これは「トレーニングフリー(追加の学習を必要としない)」の手法を用いて、スタイルが変化している間も、新しい画像が元の写真と同じ基本的な構造を維持しているかどうかを常にチェックします。

結果は非常に有望です。研究者たちがWikiArtデータベースにある8万点以上の芸術作品を用いてシステムをテストしたところ、GSTは、古い手法と比較して、芸術家の真の、多様な自己をより強く感じさせる画像を生成することがわかりました。他の技術はしばしば単一の有名なルックに行き詰まったり、ぼやけた一貫性のない結果を生み出したりしましたが、GSTは芸術家の「全スペクトラム」を捉えることができました。例えば、ゴッホ風の画像を生成する際、システムは単に『星月夜』をコピーするのではなく、彼の全作品の雰囲気に忠実な、多様な渦巻く質感のあるシーンを作り出しました。データは、この手法が、単にいくつかの有名なパターンを「記憶」することを回避し、より豊かで忠実な芸術家の視覚的アイデンティティの表現を学習しつつ、元の写真の被写体を認識可能な状態に保っていることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →