Towards Controllable Image Generation through Representation-Conditioned Diffusion Models
本文提出了一种可控图像生成框架,该框架利用预训练自监督模型的表示来条件化扩散过程,从而在无需大量标注数据集的情况下,既提升了无条件生成的质量,又实现了对输出变化的平滑且解耦的控制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一位神奇的画家,可以绘制任何你想要的画面,但你只能用模糊的低语与他们交流,比如“让它更漂亮”或“让它更可怕”。这就是当前人工智能图像生成器(称为扩散模型)通常的工作方式。它们擅长创作精美的艺术作品,但如果你想只改变一个微小的细节——比如将一个人的头发从棕色变成红色,而不改变其脸型或背景——这往往就像试图用牙签去操控一艘巨轮。你可能成功改变了发色,却可能无意中改变了这个人的年龄或画面中的天气。
本文介绍了一种与这位神奇画家交流的新方法。作者们不再仅仅使用文字,而是教会画家去“聆听”一种秘密语言:视觉蓝图。
新方法:蓝图系统
作者构建了一个包含两个主要部分的系统,它们像一个团队一样协同工作:
- 翻译器(编码器):想象一位超级聪明的翻译,它研究过数百万张照片。这位翻译不讲英语或西班牙语,它讲的是“视觉蓝图”。当你向它展示一张教堂或人脸的照片时,它会立即将该图像转换为一个独特的、紧凑的代码(一组数字),捕捉图像的精髓。作者使用了一个预训练的“自监督”模型(称为 DINO)来完成这项工作。它通过单纯观察图像就学会了理解图像,而无需人类进行标注。
- 画家(扩散模型):这就是那位艺术家。这位艺术家不再根据文本提示去猜测要画什么,而是查看翻译器提供的“视觉蓝图”,并据此绘制图像以匹配该代码。
为什么这更好?
论文声称,这种方法提供了两大主要“超能力”:
1. 更平滑的过渡(“淡入淡出”效果)
如果你想把一张教堂的图片变成一张城堡的图片,你可以取教堂的“蓝图”和城堡的“蓝图”,在中间将它们混合在一起。
- 旧方法:使用标准方法,混合它们通常会导致杂乱的模糊,或者从一个图像到另一个图像出现突兀、刺眼的跳跃。
- 本文的方法:作者发现,混合这些蓝图会产生平滑、渐进的淡入淡出效果。图像会缓慢地从教堂变形为城堡,细节自然地一步步变化,而不是突然跳变或出现故障。
2. 控制细节(“旋钮”效果)
作者发现,你可以在蓝图空间中转动特定的“旋钮”来改变特定的特征。
- “有监督”旋钮:如果你向系统展示许多金发人物的照片,它就会学会“金发蓝图”。然后,你可以拿一张黑发人物的照片,将“金发蓝图”添加到其中,人工智能就会将他们的头发变成金色,同时保持其他一切不变。
- “无监督”旋钮:即使没有人类告诉人工智能“金发”长什么样,系统也能自行发现模式。通过分析蓝图,它找到了自然控制额头大小、头发长度或背景颜色等事物的“旋钮”。这就像在图像代码内部发现了一个隐藏的控制面板,让你可以微调特定的属性。
结果
作者在教堂和人脸(Celeb-A)的图片上测试了这种方法。他们发现:
- 即使进行了大幅修改,图像依然保持高质量。
- 变化是平滑的(没有突兀的跳跃)。
- 变化是解耦的(改变头发不会意外地改变性别或背景)。
总结
可以将这篇论文理解为教会了一位人工智能艺术家一种新语言。与其给出模糊的指令,不如给它一份精确的视觉蓝图。这使得艺术家不仅能画出更好的图片,还能让你以特定的方向轻轻推动图片——比如转动旋钮改变发色,或将一座建筑平滑地淡入另一座建筑——而不会破坏图像的其他部分。这是迈向使人工智能图像生成更具可预测性和可控性的一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。