← 最新论文
🤖 AI

VIPaint: Image Inpainting with Pre-Trained Diffusion Models via Variational Inference

本文提出了 VIPaint,这是一种分层变分推断算法,通过优化真实扩散后验的非高斯马尔可夫近似,实现了高质量、多样化的图像修复及其他逆问题求解,从而有效解决了现有方法在处理大面积掩蔽区域和潜在扩散模型方面的局限性。

原作者: Sakshi Agarwal, Gabriel Hope, Jimin Heo, Erik B. Sudderth

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Sakshi Agarwal, Gabriel Hope, Jimin Heo, Erik B. Sudderth

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一张精美的高分辨率照片,但有人用巨大的、凌乱的记号笔涂画了其中很大一部分。你想修复它,却不知道涂鸦下面原本是什么。那是一只猫?一辆车?还是一座山?

这就是图像修复(image inpainting)所面临的问题。长期以来,计算机在填补这些巨大的缺失区域时,往往会让画面变得模糊、怪异或完全错误。

现在,VIPaint 登场了,这是本文介绍的一种新方法。不要把 VIPaint 想象成一个只会猜测的画家,而要把它看作一位超级聪明的侦探,它利用庞大的“如果……会怎样”的图书馆来解决缺失像素的谜团。

以下是其工作原理的简化概念分解:

1. “魔法图书馆”(预训练扩散模型)

首先,想象一台计算机花费数年研究了数百万张照片。它学会了世界呈现的“规则”:猫的耳朵如何连接到头部、云朵在天空中如何分布,或者车轮如何契合车身。在论文中,这被称为扩散模型(Diffusion Model)。

把这个模型想象成一座魔法图书馆,收藏了所有可能存在的图像。如果你让它画一只“猫”,它确切知道猫长什么样,因为它之前已经见过所有的猫。

2. 旧方法的问题(“猜谜游戏”)

以前的方法试图通过猜测、查看结果,然后尝试将其推回照片可见部分的方式来修复被涂画的照片。

论文指出,这就像在黑暗的房间里行走:迈一步,绊一下,然后希望不要撞到墙。如果缺失的部分很大(比如整张脸),这些旧方法往往会迷失方向。它们可能会用猫头填补空洞,但身体却看起来像狗,或者颜色与房间其余部分不匹配。它们在填补细节的同时,难以保持“大局”的一致性。

3. VIPaint 的秘密武器:“分层地图”

VIPaint 通过一种称为变分推断(Variational Inference)的技术改变了游戏规则。VIPaint 不只是猜测最终图像,而是构建一张分层地图(逐步指南),以此在魔法图书馆中导航。

以下是类比:

  • 旧方法试图直接从“纯噪声”(静电)跳到“最终图像”。它们经常绊倒并摔成一团乱麻。
  • VIPaint 则在沿途的多个“检查点”停下。想象你正在下山寻找一个隐藏的山谷(缺失的图像)。
    • 检查点 1(高处): 你观察大局。“好吧,这肯定是一片森林,而不是城市。”
    • 检查点 2(中途): 你看到了树木。“好吧,这些是松树,不是棕榈树。”
    • 检查点 3(接近底部): 你看到了具体的树枝和树叶。

VIPaint 同时优化这些检查点。它确保“大局”(森林)与“小细节”(松针)相匹配,并且 确保所有内容与照片中未被涂画的部分保持一致。

4. 为何它更出色(“可塑的黏土”)

论文声称 VIPaint 之所以特殊,是因为它将缺失的图像视为可塑的黏土,而不是僵硬的雕像。

  • 不确定性: 如果照片中有一个大洞,答案并不只有一个正确的。可能是一只猫、一只狗或一只狐狸。VIPaint 理解这一点。它不强迫计算机立即只选择一个“正确”答案。相反,它保持选项开放(即“不确定性”),直到从图像的可见部分收集到足够的线索来缩小范围。
  • 零样本学习(Zero-Shot Learning)这是一个重大突破。VIPaint 不需要针对每种新类型的照片重新训练。它采用预训练的“魔法图书馆”(例如用于 Stable Diffusion 的那个),并立即将其调整以适应你特定的涂画照片。这就像一位主厨,无需先去烹饪学校,就能利用你刚刚递给他的食材为你做出一顿完美的饭菜。

5. 结果:锐利、真实且多样

论文在多种场景下测试了 VIPaint:

  • 填补巨大空洞: 即使图像缺失了 50-80%,VIPaint 也能填入与图片其余部分相匹配的逼真细节。
  • 修复模糊照片: 它还能锐化模糊图像(去模糊)或将小照片放大(超分辨率)。
  • 文本到图像: 即使在使用最先进的文本引导图像生成器(如 Stable Diffusion 3.5)时,它也能发挥作用,生成的图像不仅锐利,而且在整体上合乎逻辑。

总结:
VIPaint 是一种修复破损或被涂画照片的新方法。它不是盲目猜测,而是利用一种智能的、逐步的策略来导航庞大的图像知识库。它同时检查“大局”和“小细节”,确保最终结果逼真、锐利且一致,即使图像的大部分缺失也能做到。这一切都无需重新训练,使其成为修复图像的强力“即插即用”工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →