← 最新论文
📊 statistics

Discrete diffusion samplers and bridges: Off-policy algorithms and applications in latent spaces

本文介绍了针对离散扩散采样器的离线策略训练技术以及一种新颖的数据到能量薛定谔桥框架,证明了它们在提升合成基准测试采样性能方面的有效性,并实现了图像生成模型离散潜在空间内的无数据后验采样。

原作者: Arran Carter, Sanghyeok Choi, Kirill Tamogashev, Víctor Elvira, Nikolay Malkin

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Arran Carter, Sanghyeok Choi, Kirill Tamogashev, Víctor Elvira, Nikolay Malkin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图在一个巨大、黑暗的剧院(即“目标分布”)中找到最佳座位。你知道剧院的布局以及好座位的位置(即“能量函数”),但你不知道座位的总数,而且由于灯光熄灭,你无法直接走进去挑选座位。你需要一位向导来引领你找到好座位。

多年来,科学家们为连续空间(如平滑的地面)拥有了出色的向导,但在离散空间(如由特定、独立座位组成的网格)中,向导往往笨拙不堪。它们会困在剧院的某个区域,或者错过整排的好座位。

本文介绍了一种利用离散扩散采样器(Discrete Diffusion Samplers)训练这些向导的新颖且更智能的方法。以下是其三大核心创新的简要解析:

1. “回放缓冲区”与“侦察兵”(离线策略训练)

问题:想象一位导游只通过行走当前路径来学习。如果它被困死胡同,它就永远无法了解隔壁房间的好座位。它是“在线策略”(on-policy)的,意味着它只从自己当下的错误中学习。

解决方案:作者教导导游使用离线策略(Off-Policy)技术。

  • 回放缓冲区(Replay Buffer):将其想象为一个记忆库。导游保存它曾经走过的每一条有趣路径,即使那是几周前的事。在训练时,导游不再仅仅行走当前路径,而是回顾这些旧路径以从中学习。
  • 侦察兵(MCMC):有时,导游需要一点推动力来打破僵局。作者加入了一位“侦察兵”(一种马尔可夫链蒙特卡洛算法)。这位侦察兵是一个局部探索者,可以在附近的座位间跳跃以寻找更好的位置,并将这些信息反馈给主导游。

结果:通过使用这个记忆库和侦察兵,导游学习得更快,并且关键的是,它能找到剧院中所有的好座位(模式),而不仅仅是它最初偶然发现的那些。在论文的测试中,这种方法防止了导游被困在房间的某个角落。

2. “桥梁构建者”(数据到能量的薛定谔桥)

问题:通常,你想从点 A(一个简单、已知的分布)到达点 B(你的复杂目标)。但如果点 B 不是一份你能看到的座位清单呢?如果点 B 只是一套描述座位“有多好”的规则(能量函数),而没有向你展示座位本身呢?

解决方案:作者在两个世界之间构建了一座桥梁

  • 想象你拥有一张城市地图(点 A)和一份仅由声誉评分定义的“最佳社区”列表(点 B)。
  • 本文构建了一座“薛定谔桥”,将已知地图连接到声誉列表。它学习了从已知城市走向基于声誉的社区的路径,即使你在到达之前无法看到目的地。
  • 他们首次在“离散”世界(座位是离散的块,而非平滑的街道)中实现了这一点。

结果:他们成功构建了一条从简单起点到复杂、基于规则的目的地的路径,在论文中可视化为从三个高斯分布的混合体移动到两个高斯分布的混合体,并表示为二进制代码。

3. 图像生成器的“翻译官”(外包采样)

问题:现代 AI 图像生成器(如那些生成猫或数字图片的模型)通常在“潜在空间”中工作。将其想象为 AI 用来理解图像的加密代码语言。有时,你想强制 AI 生成特定类型的图像(例如,“仅生成奇数”),但你无法直接告诉 AI 如何做到这一点。

解决方案:作者利用他们的新向导直接在这种加密代码语言中进行采样。

  • 他们不再试图逐像素地修正图像,而是训练他们的向导在预训练图像模型(VQ-VAE)的离散潜在空间(加密代码)中进行导航。
  • 他们告诉向导:“找到那些解码后看起来像数字'5'或'7'的代码。”

结果:向导成功学会了导航加密代码,以生成特定数字(如 1、5、7)和类别(奇数与偶数)的图像,而无需在训练过程中看到最终图像。它有效地将寻找正确图像的艰巨工作“外包”给了在代码空间中工作的向导。

总结

简而言之,本文将一种用于平滑、连续问题的强大采样技术进行了调整,使其适用于离散、块状的问题(如网格或代码)。

  1. 它通过让采样器记住过去的路径并使用局部探索者来避免陷入困境,从而使其变得更聪明。
  2. 它构建了一座桥梁,以到达仅由规则定义而非由示例定义的目标。
  3. 它证明了该方法适用于图像生成,允许 AI 通过导航其内部的“加密代码”语言来寻找特定图像。

论文声称,这些方法始终优于先前的技术,特别是在采样器倾向于陷入单一解决方案而非探索所有好方案的困难场景中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →