← 最新の論文
🤖 machine learning

Advanced Image Generation: Negative Prompt Optimization and Latent Classifier Guidance

本論文は、自動的なネガティブプロンプト最適化のためのファインチューニングされたシーケンス・トゥ・シーケンスLLMと、アーティファクトを低減し意味的忠実度を高めるための潜在空間ガイダンスのためのCNN-RNNハイブリッド分類器を組み合わせた、Stable Diffusionのための新しいデュアルガイダンスフレームワークを提案する。

原著者: Vaddi Charan Sai Nandan Reddy, Harini B, Chandana M S

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Vaddi Charan Sai Nandan Reddy, Harini B, Chandana M S

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

技術要約:ネガティブプロンプト最適化と潜在空間分類器ガイダンスによる高度な画像生成

問題提起
Stable Diffusionのような拡散モデルはテキストからの画像生成に革命をもたらしたが、視覚的なアーティファクト(ノイズ)、意味的なドリフト(意図の逸脱)、およびユーザーの意図への厳密な追従性の欠如という課題に頻繁に直面する。既存のソリューションは、ネガティブプロンプトのエンジニアリングと分類器ガイダンスを別々の課題として扱っていることが多い。本論文では、これらの問題を軽減するために、ネガティブプロンプトの最適化と潜在空間での評価を通じた拡散プロセスの誘導を同時に行う統合フレームワークを提案する。

手法
提案システムは、Streamlitアプリケーションを介して実装された、3つのコアモジュールをモジュラー・パイプラインに統合したものである:

  1. ネガティブプロンプト最適化: 著者らは、ネガティブプロンプトの生成を条件付き言語タスクとしてモデル化している。彼らは、クロスエントロピー目的関数を用いた教師あり微調整(SFT)を用いて、事前学習済みSeq2Seqモデル(T5-base)をプロンプトとネガティブプロンプトのペアで微調整した。推論時には、ビームサーチアルゴリズムを用いて、不要な特徴を抑制するための最適化されたネガティブプロンプト(pp^-)を動的に生成する。

  2. 拡散エンジン: システムは、決定論的なサンプリングのためにDDIMスケジューラを備えたStable Diffusionパイプラインを利用する。UNetは、入力テキストの埋め込み(ポジティブプロンプト p+p^+ と生成されたネガティブプロンプト pp^- から派生)に基づいてノイズを予測し、潜在表現 ztz_t を更新する。

  3. 潜在分類器ガイダンス: 新しい「ImprovedLatentCNN RNN Classifier」が、拡散ステップ中の中間潜在状態を評価する。このハイブリッドアーキテクチャは、以下で構成される:

    • CNNエンコーダが、4チャンネルの潜在ベクトルから空間的特徴を抽出する。
    • 双方向GRUが、これらの一連のステップにわたって特徴を集約する。
    • MLPが、受容確率(sts_t)を決定するためのロジットを出力する。

    システムは「ロールバック」メカニズムを採用している:分類器の信頼度スコアが閾値(τ=0.5\tau = 0.5)を下回り、かつロールバック制限(R=5R=5)に達していない場合、システムは直前の受理された潜在状態に差し戻し、低品質な更新を事実上破棄する。

主な貢献

  • 自動ネガティブプロンプト生成: 手作業による作成に代わり、効果的なネガティブプロンプトを自動生成するための、微調整されたSeq2Seq LLMの導入。
  • デュアルガイダンスフレーム構想: ネガティブプロンプトの最適化と、望ましくない潜在更新をロールバックすることで拡散ステップを動的に誘導するCNN–RNNハイブリッド分類器との、新しい統合。
  • オープンソース実装: デモンストレーションと実験のためのユーザーフレンドリーなStreamlitインターフェースを備えた、オープンソースプロジェクトとしてのシステムの公開。

実験結果
本論文は、合成潜在シーケンスデータセット(10ステップのシーケンスを表す200個のラベル付きサンプル)を用いた経験的評価を提示している:

  • 分類器の性能: 「ImprovedLatentCNN RNN Classifier」は、ホールドアウトテストセットにおいて低い性能を示した。精度は0.400、ROC AUCは0.4261であり、ランダムな推測の閾値である0.5を下回った。統計テスト(対応のあるt検定)により、このモデルはVanilla CNNベースライン(AUC 0.4511)や、Logistic RegressionおよびSVMといった他のベンチマークよりも有意に劣る性能であることが確認された。
  • 定性的主張: 分類器の定量的な限界にもかかわらず、著者らは、デュアルガイダンスフレームワークを適用した場合、視覚的なアーティファクトが減少し、ベースラインの拡散技術と比較して意味的な忠実度が向上すると主張している(図1–3の視覚例は、「霧がかった森の中の鹿」というプロンプトに対して、システムが「変形、ぼやけ、不適切な解剖学的構造」といった最適化されたネガティブプロンプトを生成できることを示している)。

意義と限界
本論文は、より制御可能で意味的に整合性の取れたテキストからの画像生成に向けた有望な方向性として、本研究を位置づけている。著者らは、モジュール式アーキテクチャにより、独立したトレーニングと容易なアブレーション研究が可能であることを強調している。

しかし、著者らは分類器の有効性に関して極めて謙虚である。彼らは、分類器の指標(AUC < 0.5)が、現在のデータセットにおいてランダムな推測よりも劣る性能であることを示しており、大幅な改善の余地があることを明示的に認めている。結論では、将来の研究において、アーキテクチャの再設計、高度な正則化、またはより高品質なラベル付きデータを通じて、分類器モジュールの改善に焦点を当てなければならないとしている。本論文は、現在のシステムがすべての指標において最先端(SOTA)であると主張しているのではなく、これら2つのガイダンスメカニズムを統合するためのフレームワークを確立したものであり、潜在ガイダンスコンポーネントにはさらなる開発が必要であるという理解に基づいている。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →