Your Pre-trained Diffusion Model Secretly Knows Restoration
该论文揭示预训练扩散模型内蕴修复能力,通过提出一种基于扩散桥框架的不稳定提示学习新方法,直接优化文本编码器输出的提示嵌入,从而在不进行微调或添加控制模块的情况下,将预训练的 WAN 视频和 FLUX 图像模型转化为具有卓越泛化能力的通用图像修复模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文讲了一个非常有趣的故事:那些原本用来“画画”的超级人工智能(扩散模型),其实私下里早就学会了“修图”,只是我们一直没找到打开这个技能的钥匙。
想象一下,你有一个超级天才画家(这就是预训练的扩散模型,比如 FLUX 或 WAN)。他看过世界上所有的名画,脑子里装满了关于“什么是美好画面”的知识。
1. 以前的困境:只会听“画什么”,不会听“怎么修”
以前,如果你想让这位画家帮你把一张模糊、有雾、或者被雨淋湿的照片修好,你会怎么做?
- 方法 A(微调): 你让画家重新去上培训班,专门学修图。但这很贵,而且学完可能他就忘了怎么画新东西了(失去了原本的强大能力)。
- 方法 B(控制网): 你给画家旁边加一个“助手”,专门负责指挥他怎么修。但这就像给画家加了个拐杖,虽然能走,但不够灵活,而且这个助手得专门训练。
- 方法 C(直接说话): 你直接对画家说:“把雾去掉!”或者“把雨擦掉!”
- 结果: 画家很困惑。他虽然能听懂“画一朵花”,但他听不懂“把这张烂图修好”。如果你让他修图,他往往只是把噪点抹平,但雾还是雾,雨还是雨,图看起来还是脏脏的(就像论文图 1 和图 2 展示的那样)。
2. 核心发现:钥匙不在“语言”里,而在“感觉”里
作者发现了一个惊人的秘密:这位画家其实早就知道怎么修图! 他的脑子里有修复图像的能力,只是我们之前的沟通方式(用文字提示词)太笨拙了,没传达对。
- 之前的尝试(Token 优化): 我们试图通过优化“文字”本身(比如把“去雾”这个词换成更神秘的代码词)来唤醒画家。但这就像试图用错误的方言跟一个懂多种语言的人说话,他依然听不懂你的深层意图。
- 作者的突破(Embedding 优化): 作者发现,如果直接调整画家大脑深处的“感觉向量”(也就是文字编码器输出的那个抽象的“感觉”,而不是具体的文字),画家瞬间就懂了!
- 比喻: 以前我们是用“文字指令”去指挥画家,现在我们是直接给画家的大脑“注入一种感觉”。这种感觉很微妙,就像你不需要告诉画家“怎么画”,而是直接让他感受到“这张图应该是清晰的”。一旦有了这种感觉,画家就能利用他原本强大的知识,自动把脏图变干净。
3. 遇到的新问题:训练和考试“穿帮”了
虽然找到了钥匙,但作者发现了一个新问题:训练时的环境和考试时的环境不一样。
- 训练时: 我们给画家看一张“脏图 + 一点点噪点”,让他猜“原图长啥样”。
- 考试时(推理): 我们要从一张“很脏的图”开始,一步步把它变干净。
- 问题: 就像你教学生做题,训练时你只让他做“稍微有点难的题”,结果考试时突然给他一张“超级难的题”,学生就懵了,画出来的图会有奇怪的瑕疵(比如图 6 里的伪影)。这是因为训练的路径和实际修复的路径对不上。
4. 终极解决方案:搭建一座“桥梁”
为了解决这个问题,作者设计了一种**“桥梁训练法”**(Diffusion Bridge)。
- 比喻: 想象你要从“脏房子”走到“干净房子”。
- 以前的方法: 训练时,你让画家在“脏房子”旁边转圈;考试时,却要他直接走进“干净房子”。他当然会迷路。
- 作者的方法: 在“脏房子”和“干净房子”之间修一座平滑的桥。
- 训练时,让画家走这座桥,从“有点脏”慢慢走到“很干净”。
- 考试时,也让画家走这座桥。
- 效果: 这样画家在训练和考试时走的每一步路都是一样的,他就能稳稳地把脏图修好,而且修得非常自然、逼真。
5. 成果:轻量级、通用且强大
作者用这个方法,给两个超级大模型(FLUX 负责图片,WAN 负责视频)加上了这种“特制感觉提示词”(Prompt)。
- 不用重练: 不需要重新训练那个几十亿参数的超级大脑,只需要训练一点点小小的“提示词”(就像给画家戴了一副特制眼镜)。
- 什么都能修: 无论是去雾、去雨、去雪、去模糊,还是暗光增强,只要戴上对应的“眼镜”,画家就能搞定。
- 效果惊人: 在测试中,他们的效果比那些专门训练过的“修图专家”还要好,而且能处理很多以前没见过的复杂情况(比如混合了雨和雾,或者从未见过的屏幕反光)。
总结
这篇论文告诉我们:有时候,我们不需要给 AI 重新上课,只需要换一种更聪明的方式跟它沟通。
作者发现,预训练的大模型里藏着“修图”的超能力,只要通过直接调整大脑的“感觉”,并配合**“桥梁式”的训练路径**,就能把这种沉睡的能力唤醒。这就像给一个只会画画的魔术师,悄悄递了一张写着“修复咒语”的纸条,他瞬间就能把破布变成锦缎,而且不需要重新学习魔法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。