← 最新论文
📄 other

Diffusion Model-Based Image Restoration: Interactive Learning of Determinism and Stochasticity

本文提出了一种用于图像修复的新颖扩散框架,该框架通过对确定性和随机性的交互建模,以有效地适应不同退化任务的异构需求,从而在多种修复场景中实现了卓越的性能和可解释性。

原作者: Sha Luo, Siyuan Peng, Dawei Zhao, Qingwei Gao

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Sha Luo, Siyuan Peng, Dawei Zhao, Qingwei Gao

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图修复一张模糊、有雨滴或昏暗的照片。在计算机科学领域,这被称为“图像复原”(Image Restoration)。长期以来,计算机尝试通过学习严格的规则来修复这些照片,比如“雨总是长成这样”或“阴影总是那样”。但现实世界是混乱的;雨可以是暴雨也可以是细雨,阴影也可以是奇形怪状的。最近,一种名为“扩散模型”(Diffusion Model)的新型人工智能因修复图像而声名大噪。你可以把扩散模型想象成一位雕塑家,他从一块充满噪声的静态块(就像电视雪花一样)开始,通过慢慢凿去噪声,最终显现出一尊完美的雕像。问题在于,这位雕塑家通常对每一尊雕像都采用同样的工作方式。如果你需要一尊极其锐利(如医学扫描图)的雕像,雕塑家可能会把它雕刻得过于扭曲;如果你需要一尊具有多种可能版本的绘画风格雕像,雕塑家可能会让它显得过于僵硬。研究人员提出的核心问题是:我们如何教这个 AI 雕塑家,让它知道何时该精准,何时该富有创意,并且在一次过程中同时实现这两点?

这篇论文介绍了一种教导 AI 雕塑家的聪明新方法,称为“确定性与随机性的交互式学习”。用通俗的话说,“确定性”(determinism)是指那个严格、可预测且遵循清晰路径的部分(就像完全按照食谱操作);而“随机性”(stochasticity)则是指那个随机、灵活且允许惊喜的部分(就像根据口味加一撮盐)。作者罗沙及其来自安徽大学的团队注意到,以往的方法试图将这两个概念分开处理,就像有两个不同的雕塑家在雕刻同一尊雕像,但彼此之间却互不沟通。这往往会导致混乱或浪费精力。

相反,该团队设计了一个全新的框架,让“严格”路径和“随机”路径不断进行对话。他们构建了一个由两个简单的 AI 大脑(称为 U-Net)组成的系统,它们协同工作。一个大脑专注于图像中可预测的部分(即“残差”,例如雨滴等特定损伤),另一个大脑则专注于随机噪声。但神奇之处在于:它们并不只是并行工作,而是会及早分享彼此的想法和特征。这就像拥有一支由两位厨师组成的团队:一位是精确测量的大师,另一位是即兴发挥的大师。他们不再是各自烹饪不同的菜肴,而是互相品尝对方的食材,并实时调整自己的烹饪方式。如果图像需要极高的锐度,那么“严格”的厨师就会占据主导地位;如果图像需要看起来自然且多样化,那么“创意”的厨师就会介入。他们通过动态交互,为解决每一个具体问题找到完美的平衡点。

研究人员在四种非常不同的任务上测试了这支“交互式”团队:去除照片噪声、消除阴影、提亮昏暗图像以及清理窗户上的雨迹。他们发现,这种方法在所有任务中都表现得极其出色。例如,在去除雨滴时,他们的模型能够彻底抹去雨痕,而其他模型要么留下了一些雨迹,要么让图片看起来很奇怪。他们还发现,通过让这两条路径进行交互,AI 不需要花费那么多步骤就能完成工作。虽然有些模型需要 1,000 个步骤来清理一张照片(这需要很长时间),但他们的模型仅需 2 到 4 个步骤即可完成,速度大大提升。

论文指出,这种方法是一个重要的进步,因为它并不强迫 AI 只能是其中一种状态。通过让“确定性”和“随机性”部分相互学习,模型变成了一只变色龙,能够适应图像的具体需求。作者承认,虽然它在处理昏暗照片中非常复杂的灯光变化时偶尔会遇到一点困难,但总体而言,它比竞争对手能更好地保留细节和纹理。他们甚至已经在网上分享了代码,邀请其他人亲自尝试这种“交互式”烹饪法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →