← 最新论文
💻 computer science

Coevolving Representations in Joint Image-Feature Diffusion

本文提出了 Coevolving Representation Diffusion (CoReDi) 框架,通过在训练过程中联合学习轻量级线性投影使语义表示空间自适应演化,从而解决了现有联合图像 - 特征扩散模型中固定表示空间的局限性,显著提升了生成模型在 VAE 潜在空间和像素空间下的收敛速度与样本质量。

原作者: Theodoros Kouzelis, Spyros Gidaris, Nikos Komodakis

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Theodoros Kouzelis, Spyros Gidaris, Nikos Komodakis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 CoReDi(共演化表示扩散)的新方法,旨在让 AI 画图画得更好、更快。

为了让你轻松理解,我们可以把 AI 画图的整个过程想象成**“一位画家(生成模型)和一位艺术评论家(语义特征)”的协作过程**。

1. 以前的做法:死板的“翻译官”

在 CoReDi 出现之前,AI 画图的流程是这样的:

  • 画家:负责在画布上涂抹像素,决定画面的细节(比如猫耳朵的形状、毛发的纹理)。
  • 评论家:是一个预先训练好的、非常聪明的“艺术专家”(比如 DINOv2 或 MOCOv3)。它能一眼看出画的是“猫”还是“狗”,理解画面的高级概念。
  • 翻译官(固定投影):为了让画家能听懂评论家的话,中间需要一个“翻译官”。以前的做法是,这个翻译官是固定不变的。比如,无论画家怎么进步,翻译官都只会用一种死板的方式(比如 PCA 降维)把评论家的“高深术语”翻译成画家能懂的“简单指令”。

问题在于:这个死板的翻译官并不懂画家具体需要什么。有时候翻译得太啰嗦,有时候又漏掉了关键信息,导致画家和评论家配合得不够默契,画出来的东西要么像,要么细节不够好,而且训练得很慢。

2. CoReDi 的创新:让“翻译官”和“画家”一起成长

CoReDi 的核心思想是:不要让翻译官固定不变,而是让他和画家一起“共演化”(Coevolve)。

想象一下,我们不再雇佣一个死板的翻译官,而是雇佣了一个**“学徒翻译官”**。

  • 共同学习:在训练过程中,画家(生成模型)和学徒翻译官(可学习的投影层)是手拉手一起训练的。
  • 动态调整:随着画家画技的进步,学徒翻译官也会根据画家的需求,动态调整自己的“翻译风格”。它不再死板地翻译,而是学会:“哦,画家现在需要更强调‘猫耳朵’的轮廓,那我就把这部分信息翻译得更清晰一点。”
  • 结果:经过一段时间的训练,这个翻译官变得非常懂画家,它翻译出的指令完美契合画家的需求,两人配合得天衣无缝,画出的画既像(语义准确)又美(细节丰富)。

3. 遇到的挑战与解决方案:防止“偷懒”和“崩溃”

如果直接让学徒翻译官和画家一起学,会出现两个大问题,论文作者巧妙地用三个“法宝”解决了它们:

  • 挑战一:翻译官“偷懒”(退化)

    • 现象:如果翻译官的目标也是可变的,它可能会想:“哎呀,为了降低错误率,我干脆把翻译结果变成全是‘零’或者全是‘一样’的东西吧,这样画家随便画都不会错。”这会导致翻译失去意义。
    • 法宝 1:停止梯度(Stop-Gradient):这就好比给翻译官设了一个“不可修改的参考书”。在计算翻译错误时,我们冻结参考书的内容,不让它被修改。这样,翻译官就不能靠“乱改参考书”来作弊,必须真正学会怎么翻译才能减少错误。
  • 挑战二:翻译官“崩溃”(特征坍塌)

    • 现象:有时候翻译官虽然没偷懒,但它变得很“无趣”。比如,它把所有不同的猫都翻译成同一种信号,或者所有通道都输出一样的信息。这就叫“特征坍塌”,就像所有颜色的颜料都混成了灰色。
    • 法宝 2:批归一化(Batch Normalization):这就像给翻译官加了一个“音量控制器”,确保它输出的信号大小适中,不会忽大忽小,保持训练稳定。
    • 法宝 3:显式正则化(Explicit Regularization):这是最关键的“强迫症”疗法。我们给翻译官定下规矩:“你输出的每一个通道(比如红、绿、蓝通道)都必须要有独特的变化,不能大家都一样。”
      • 方差正则化:强迫每个通道都要有“活力”,不能死气沉沉。
      • 正交/协方差正则化:强迫不同通道之间要“分工明确”,不能互相重复说废话。

4. 实际效果:快人一步,画得更好

论文通过实验证明,这种“共演化”的方法非常有效:

  • 速度更快:在同样的训练时间下,CoReDi 画的图质量比旧方法高得多。就像那个学徒翻译官,只用了别人一半的时间,就达到了大师级的配合水平。
  • 画质更优:生成的图片不仅概念对(是猫),而且细节更丰富,空间结构更合理(猫耳朵的位置更准)。
  • 适用范围广:这个方法不仅能在压缩的“潜空间”(Latent Space,一种简化版画布)里用,甚至可以直接在原始的“像素空间”(Pixel Space,真实画布)里用,打破了以往必须依赖压缩技术的限制。

总结

CoReDi 就像是为 AI 画家配备了一位“随队成长的金牌翻译”。

以前的翻译是死板的说明书,现在的翻译是活生生的合作伙伴。通过特殊的训练技巧(停止梯度、归一化、强制多样性),我们防止了翻译官偷懒或变傻,让它能随着画家的进步而不断进化,最终实现了"1+1>2"的效果,让 AI 生成图像的速度和质量都上了一个新台阶。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →