← 最新の論文
💻 computer science

ReART: Reference-Guided Retrieval and Refinement for Emotion-Aware Art Generation

reARTは、キャプションを構造化された視覚的領域へと分解することで標的を絞ったリファレンス検索を可能にし、さらにAAS駆動のループを用いてアライメントの失敗を診断・修復することにより、感情を考慮したアート生成を強化する、リファレンス誘導型の検索および洗練フレームワークであり、AffectiveArt 2026 Grand Challengeにおいてトップクラスの性能を達成している。

原著者: Qianqian Tang, Jiayi Gao, Ting Lei, Yang Liu

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Qianqian Tang, Jiayi Gao, Ting Lei, Yang Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

芸術とは、単に物の姿を描くこと以上のものです。それは、感じ方そのものなのです。何世紀もの間、画家たちは筆致や色の選択、そして光が場面にどのように落ちるかを用いることで、たとえ笑顔や涙を一つも描かずに、厳粛さ、喜び、あるいは憂鬱といった感情を伝えてきました。今日、コンピュータは記述されたテキストからこれらの画像を生成することを学習しており、そのプロセスは驚くほどリアルな場面を作り出すことに長けてきました。しかし、新たな課題が浮上しています。それは、「厳粛な」雰囲気には、単に悲しい対象物を絵に追加することではなく、抑えられた色彩や平坦な空間感覚といった、具体的かつ微細な視覚的判断が必要であることを、機械に教えることです。困難の理由は、人間の言語がしばら細部を表現するにはあまりに曖昧であることにあります。人が「厳粛なルネサンス風の絵画」というプロンプトを書いて求めたとしても、コンピュータは、その感情に合わせるためにどの程度のグレーの陰影を使うべきか、あるいは筆致をどの程度厚くすべきかを正確には知りません。それは、特定のパレットや明確な質感のビジョンを与えずに、誰かにムードを描いてほしいと頼むようなものです。

これを解決するために、北京大学と武漢大学の研究者たちは、曖昧な感情を表す言葉と具体的な視覚的証拠との間の架け橋となる「ReART」と呼ばれるシステムを開発しました。このシステムは、テキストのみから適切な外観を推測しようとするのではなく、記述を、主題、場面のレイアウト、塗料の質感、そして全体的なムードといった、具体的な視覚的要素へと分解します。そして、既存の膨大な芸術作品のライブラリを検索し、これらの個々の要素に一致する実例を見つけ出します。もしプロンプトが特定の種類の筆致を求めているならば、システムはその正確な質感を持つ絵画を見つけ出し、それをガイドとして使用します。これにより、コンピュータは言葉に基づいて推測するのではなく、マスターアーティストの手によって「厳粛」や「劇的」が実際にどのような姿をしているのかを学ぶことができるのです。

このプロセスは主に2つのステップで行われます。まず、システムはテキストによる記述とライブラリーから集めた視覚的な手がかりを用いて、初期画像を生成します。次に、システムは自らが批評家となり、その結果を元の要求と照らし合わせて検証します。もし画像が主題は捉えているものの色が明るすぎたり、構図は正しいものの質感が滑らかすぎてデジタルに見えたりする場合、システムはどこで間違いが生じたのかを正確に特定します。システムは単に画像を破棄してやり直すのではありません。代わりに、すでに正しい部分を保護しながら、壊れた部分のみを修正するための具体的な計画を立てます。システムは、特定されたエラーに一致する新しい視覚的例を選択し、欠陥を修正するために画像を注意深く編集し、それによって絵画の他の部分が変更されないようにします。この検証と修正のサイクルは、画像がプロンプトの感情的および視覚的な目標と完全に一致するまで繰り返されます。

この手法の結果は、感情的な芸術生成に関する主要なコンテストにおいてテストされました。そこでは、コンテンツ、芸術的スタイル、そして微細な感情属性をどれだけうまく捉えているかによってシステムが審査されました。研究者たちは、彼らの手法が、従来の試みよりも大幅に実在の人間の手による芸術に近い画像を生成したことを発見しました。コンテストにおいて、このシステムは感情の一致度テストで満点を獲得しました。これは、与えられたすべてのケースにおいて、意図された感情を完璧に一致させることに成功したことを意味します。また、システムは全体のランキングでも第2位に入り、複雑な芸術的リクエストをより小さく管理可能な視覚的断片へと分解し、実例を用いて制作を導くことが、機械に芸術の微妙な言語を教える強力な方法であることを証明しました。この研究は、コンピュータが適切な視覚的リファレンスと自身の作業をチェックする方法を与えられれば、単にルールに従うだけでなく、感情の視覚的な質感(テクスチャ)を理解することによって、人間の感情に共鳴する芸術を生み出すことができるようになることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →