← 最新论文
🤖 machine learning

Advanced Image Generation: Negative Prompt Optimization and Latent Classifier Guidance

本文提出了一种用于 Stable Diffusion 的新型双重引导框架,该框架结合了用于自动负向提示词优化的微调序列到序列大语言模型(LLM),以及用于潜空间引导的 CNN-RNN 混合分类器,旨在减少伪影并增强语义保真度。

原作者: Vaddi Charan Sai Nandan Reddy, Harini B, Chandana M S

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Vaddi Charan Sai Nandan Reddy, Harini B, Chandana M S

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:通过负向提示词优化与潜空间分类器引导实现高级图像生成

问题陈述
尽管像 Stable Diffusion 这样的扩散模型已经彻底改变了文本生成图像领域,但它们经常受到视觉伪影、语义漂移以及无法严格遵循用户意图的问题困扰。现有的解决方案通常将负向提示词工程(negative prompt engineering)与分类器引导(classifier guidance)作为两个独立的挑战来处理。本文提出了一种统一的框架,旨在同时优化负向提示词并通过潜空间评估来引导扩散过程,以缓解这些问题。

方法论
所提出的系统通过一个 Streamlit 应用程序实现,将三个核心模块集成到一个模块化流水线中:

  1. 负向提示词优化: 作者将负向提示词生成建模为一个条件语言任务。他们使用监督微调(SFT)方法和交叉熵目标函数,在“提示词-负向提示词”对上对预训练的 Seq2Seq 模型(T5-base)进行微调。在推理过程中,通过束搜索(beam search)算法动态生成优化的负向提示词 (pp^-),以抑制不需要的特征。

  2. 扩散引擎: 系统利用带有 DDIM 调度器的 Stable Diffusion 流水线进行确定性采样。UNet 根据输入文本嵌入(由正向提示词 p+p^+ 和生成的负向提示词 pp^- 导出)预测噪声,从而更新潜表示 ztz_t

  3. 潜空间分类器引导: 一种创新的“改进型 LatentCNN RNN 分类器”在扩散步骤期间评估中间潜状态。该混合架构由以下部分组成:

    • 一个 CNN 编码器,用于从 4 通道潜向量中提取空间特征。
    • 一个双向 GRU,用于在多个步骤序列中聚合这些特征。
    • 一个输出逻辑值(logit)以确定接受概率 (sts_t) 的 MLP

    系统采用了“回滚(rollback)”机制:如果分类器对潜更新的置信度得分低于阈值 (τ=0.5\tau = 0.5) 且未达到回滚限制 (R=5R=5),系统将恢复到上一个被接受的潜状态,从而有效地丢弃低质量的更新。

核心贡献

  • 自动化负向提示词生成: 引入了经过微调的 Seq2Seq LLM 来自动生成有效的负向提示词,取代了耗时的人工手工构建。
  • 双重引导框架: 将负向提示词优化与 CNN–RNN 混合分类器创新性地结合在一起,通过回滚不理想的潜更新来动态引导扩散步骤。
  • 开源实现: 将该系统作为开源项目发布,并提供了一个用户友好的 Streamlit 界面用于演示和实验。

实验结果
论文在合成潜序列数据集(包含 200 个代表 10 步序列的标记样本)上进行了实证评估:

  • 分类器性能: “改进型 LatentCNN RNN 分类器”在留出测试集上的表现较差。它实现了 0.400 的准确率和 0.4261 的 ROC AUC,低于随机猜测的 0.5 阈值。统计检验(配对 t 检验)证实,该模型的表现明显差于 Vanilla CNN 基准(AUC 0.4511)以及逻辑回归和 SVM 等其他基准。
  • 定性主张: 尽管分类器的定量指标有限,但作者声称,当应用该双重引导框架时,与基准扩散技术相比,它减少了视觉伪影并提高了语义保真度。视觉示例(图 1–3)展示了系统生成优化负向提示词的能力(例如,针对描述“迷雾森林中的鹿”的提示词生成“变形、模糊、解剖结构错误”等词汇)。

意义与局限性
本文将这项工作定位为实现更具可控性和语义对齐的文本生成图像的一个有前景的方向。作者强调,其模块化架构允许独立训练和轻松进行消融研究。

然而,作者对分类器的有效性表现得相当谨慎。他们明确承认,分类器的指标(AUC < 0.5)表明其表现甚至不如随机猜测,这表明目前仍有巨大的改进空间。结论指出,未来的工作必须通过架构重设计、高级正则化或更高质量的标记数据来改进分类器模块。论文并未声称当前的系统在所有指标上都达到了最先进水平,而是建立了一个集成这两个引导机制的框架,并理解潜空间引导组件仍需进一步开发。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →