← 最新论文
🤖 machine learning

The Diffusion Encoder

本文介绍了扩散编码器,这是一种新颖的架构,它用扩散模型取代了传统的变分自编码器编码器,并采用受期望最大化启发的交替训练方案,以解决冲突的更新方向并实现编码器与解码器之间可靠的同步。

原作者: Akhil Premkumar, Sarah Lucioni

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Akhil Premkumar, Sarah Lucioni

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试构建一台机器,它能够观察一幅复杂的图像,将其压缩成一个微小高效的“摘要代码”,然后利用该代码完美地重建原始图像。在人工智能领域,这台机器被称为自编码器(Autoencoder)

其中,“压缩器”部分称为编码器(Encoder),而“重建器”部分称为解码器(Decoder)

多年来,编码器的行业标准一直是一种非常简单、僵化的工具:高斯分布。这就像试图将一个复杂、弯曲的形状塞进一个完美的圆球里。虽然它易于操作,但往往迫使机器为了迎合圆球的形状而忽略重要细节。

本文提出了一个大胆的问题:**如果我们在编码器中使用一种更灵活、更强大的工具会怎样?具体来说,如果我们使用扩散模型(Diffusion Model)**会如何?

问题:两人朝相反方向拉扯

扩散模型就像大师级雕塑家。它们从一块噪声开始,逐步、一步步地雕琢,最终揭示出一尊完美的雕像。它们具有极强的表现力,能够捕捉到简单“圆球”无法呈现的复杂细节。

然而,这里有一个陷阱。在传统设置中,编码器和解码器是联合训练的,它们不断调整各自的参数,以就“摘要代码”应呈现的形态达成一致。

  • 解码器希望代码非常具体,以便它能完美重建图像。
  • 编码器(如果是扩散模型)则通过一个漫长而复杂的过程来构建代码。

如果你试图像训练标准团队那样将它们联合训练,它们就会陷入混乱。它们开始朝相反的方向拉扯。解码器改变了对所需内容的看法,而需要长时间“思考”的编码器则跟不上节奏。它们失去同步,导致系统崩溃。

解决方案:“交替共舞”

作者提出了一种巧妙的新型训练方法,灵感来源于一种经典算法——期望最大化(Expectation-Maximization, EM)。他们不是强迫编码器和解码器立即达成一致,而是教导它们像舞伴一样轮流领舞与跟随。

以下是他们发明的逐步过程:

  1. 解码器领舞(M 步): 首先,解码器查看当前的“摘要代码”,并说:“嘿,如果我要完美重建这张图像,代码必须完全像这样。”它创造了一个目标景观。
  2. 编码器跟随(E 步): 作者不使用编码器直接猜测代码,而是采用“朗之万链(Langevin chain)”。想象这就像一名徒步者在探索山脉。徒步者从随机位置(当前代码)出发,沿着引导的小步向最高峰(解码器想要的完美代码)进发。
    • 关键在于,编码器无需承担“正则化”(保持简洁)的重任。内置的数学“漂移”机制处理了这一点,防止徒步者偏离地图。
  3. 更新: 一旦徒步者找到顶峰(即此刻的完美代码),编码器便从该顶峰中学习。它更新内部规则,以便下次知道如何生成该特定形状。
  4. 重复: 它们交换角色。解码器根据新代码进行更新,随后编码器再次更新。

为何这很重要

通过这种“轮流”方法,作者解决了同步问题。

  • 灵活性: 编码器不再被迫成为一个简单的圆球。它可以是一个复杂的、弯曲的形状,能够捕捉图像的真实本质。
  • 稳定性: 由于编码器是在解码器刚刚创建(并经数学平滑处理)的“目标”上进行训练的,它们不会相互对抗。它们步调一致地演进。
  • 简洁性: 编码器仍然可以使用扩散模型著名的、易于训练的“去噪”目标函数。

结果

作者在手写数字(MNIST)和小尺寸照片(CIFAR-10)等图像上测试了该方法。

  • 他们发现,新的“扩散编码器”运行稳定,并产生了清晰的重建图像。
  • 有趣的是,虽然传统的“圆球”编码器(VAE)在原始压缩效率方面仍略胜一筹,但扩散编码器已非常接近。
  • 最重要的发现是概念验证:他们证明了可以在不导致系统崩溃的情况下使用复杂的扩散模型作为编码器,这为未来研究更强大、更灵活的 AI 模型打开了大门。

一句话总结

本文介绍了一种训练 AI 编码器的新方法。与其强迫一个复杂、强大的工具(扩散模型)以僵化的传统方式工作,不如创建一种训练流程,让编码器和解码器轮流相互调整。这使得编码器能够具有更强的表现力和准确性,同时保持训练过程的稳定可控。这就像教导一个复杂的乐团演奏和谐,不是强迫每个人演奏同一个音符,而是让他们倾听并逐个声部地调整以配合指挥。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →