← 最新论文
💻 computer science

An Expectation-Maximization Algorithm for Training Clean Diffusion Models from Corrupted Observations

本文介绍了 EMDiffusion,这是一个期望最大化框架,它通过迭代地重建清晰图像并优化模型权重,使得能够直接从受损观测值中训练高质量的扩散模型,从而在无需清晰训练数据的情况下,在各种计算成像任务中实现了最先进的性能。

原作者: Weimin Bai, Yifei Wang, Wenzheng Chen, He Sun

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Weimin Bai, Yifei Wang, Wenzheng Chen, He Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和创意类比对 "EMDiffusion" 论文进行的解释。

核心问题: “鸡生蛋”的困境

想象一下,你正在试图教一个机器人如何画出完美、高质量的人物肖像。

  • 难点在于: 要教好这个机器人,你需要一个巨大的、包含完美、清晰肖像的图书馆。
  • 现实情况是: 在许多现实场景中(比如医学扫描或旧照片),你并没有完美的图片。你拥有的只有受损的图片:模糊的、有噪点的,或者缺失了大块内容(就像一个缺了零件的拼图)。

这造成了一个令人沮丧的循环:

  1. 为了修复糟糕的图片,你需要一个聪明的机器人(即“扩散模型”),它得知道一张清晰的图片应该长什么样。
  2. 但要教会机器人变得聪明,你又需要清晰的图片作为起步。

如果你没有清晰的图片,你就无法训练机器人。如果你没有机器人,你就无法修复图片。这是一个经典的**“鸡生蛋”问题**。

解决方案:EMDiffusion(“猜测与精炼”循环)

作者提出了一种巧妙的新方法,叫做 EMDiffusion,旨在打破这个循环。他们使用了一种称为**期望最大化(Expectation-Maximization,简称 EM)**的策略,这本质上是一种“猜测并精炼”的循环。

你可以把它想象成一名侦探,仅凭一段模糊的监控录像来试图破案。

第一步:“E步”(猜测)

  • 设定: 侦探最初只有一个关于一个人长相的微弱、模糊的概念(这是基于极少量、可能仅 50 张清晰照片训练得来的)。
  • 行动: 侦探观察模糊的监控录像,并尝试想象这个人原本可能长什么样。由于初始概念很弱,侦探起初可能会猜错。
  • 诀窍: 为了防止侦探只是机械地重复他已知的那些面孔,他们加入了一个“现实检查”。他们强迫这个猜测必须更紧密地贴合原始证据(即受损的数据)。
  • 结果: 他们生成了一张“重建”后的图像。它还不完美,但比原始模糊的照片要清晰一些。

第二:“M步”(精炼)

  • 行动: 现在,侦探拿着这些“重建”后的图像(它们比模糊的原图要好一些),并利用它们来重新训练其大脑中关于“人长什么样”的模型。
  • 更新: 机器人从这些新的、稍微清晰一点的猜测中学习。它更新了自己的内部“规则手册”,使其变得更加准确。
  • 结果: 机器人的智力比之前更高了。

循环过程

这个过程不断重复:

  1. 猜测: 利用更聪明的机器人再次清理模糊的照片。
  2. 精炼: 利用这些更清晰的照片让机器人变得更聪明。

通过每一次循环,机器人变得更擅长猜测,而猜测出的结果也让机器人变得更擅长训练。最终,即使在主训练阶段从未见过一张完美的照片,机器人也能学会看透噪声,发现隐藏在其中的“真实”图像。

为什么它很特别

通常,如果你尝试用糟糕的数据来训练 AI,它会学坏(比如认为所有的汽车看起来都像模糊的色块)。

  • 秘诀所在: 作者发现,以极少量的清晰数据(比如 50 张图像)作为起点,就像一颗“种子”。它能防止机器人走偏。
  • 自适应平衡: 该方法会自动调整它对“猜测”与“模糊证据”的信任程度。在开始阶段,它更信任证据以避免产生幻觉;随着机器人变得越来越聪明,它会更加信任自己的知识。

研究结果

团队在三种类型的“受损”数据上进行了测试:

  1. 图像修复(Inpainting): 填补图像缺失的部分(就像拼图)。
  2. 去噪(Denoising): 去除照片中的静电噪声或颗粒感。
  3. 去模糊(Deblurring): 修复因相机抖动而拍摄的模糊照片。

在所有案例中,他们的方法都显著优于以往那些试图从糟糕数据中学习的尝试。他们成功创造了一个能够生成高质量、清晰图像的机器人,有效地解决了这个“鸡生蛋”的问题,而无需在开始时拥有庞大的完美照片库。

总结

EMDiffusion 是一个自我进化的系统。它从一点关于“好”的提示开始,利用这个提示来清理“坏”的数据,然后再利用清理后的数据来学习如何做得更好。这就像一名学生,从一张草图开始练习绘画,通过不断的练习逐渐成为大师,而整个过程中从未见过完美的教科书。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →