Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives
本文提出了 Dualin,一种两阶段反转方法,该方法通过共同恢复人类可解释的文本提示词和目标图像的精确潜噪声,旨在克服现有技术的局限性,并实现具有可控编辑能力的先进图像保真度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在尝试逆向工程一个神奇的食谱。你面前有一个美味的蛋糕,你的目标是弄清楚究竟该如何再次烘焙出它。在计算机科学领域,特别是在一个被称为“计算机视觉”的领域中,存在着一些被称为“文本生成图像扩散模型”的神奇程序。这些模型就像是极其才华横溢的厨师,只要你给出正确的文本指令(提示词),它们就能烘焙出任何你描述的蛋糕。但如果你想反向操作呢?如果你有一个特定的、完美的蛋糕(图像),而你想知道究竟使用了哪些文本指令来制作它?这被称为“提示词反转”(prompt inversion)。
长期以来,科学家们试图通过观察蛋糕并猜测食谱来解决这个问题。有些人尝试通过数学方式调整食谱中的词汇,直到它们相匹配,但结果往往很混乱,就像一个写着“加入面粉!!和 zardoz”的食谱。有些人尝试编写清晰、人类可读的食谱,但当他们尝试用这些词再次烘焙蛋糕时,结果看起来与原图完全不同——它缺失了特定的纹理、光影和微小的细节。一个大问题是:为什么即使食谱词汇看起来是对的,蛋糕看起来却还是不一样?答案在于一个大多数人忽略了的隐藏成分: “噪声”。请不要把这种噪声看作垃圾,而要把它看作决定蛋糕精确形状和结构的特定随机火花。如果没有捕捉到那个火花,无论你的食谱词汇多么出色,你也无法完美地重现这个蛋糕。
本文介绍了一种名为 Dualin(双重反转)的新方法,它通过同时观察两样东西来解开这个谜题:食谱(文本提示词)和隐藏的火花(噪声)。研究人员认为,试图仅通过猜测文本来逆向工程一张图像,就像仅通过描述油漆颜色来重建一座房子一样;你会错过蓝图。他们的方法是一个两步走的舞蹈。首先,他们使用一组聪明的 AI 工具——一个视觉语言模型来描述场景,一个 CLIP 系统来寻找合适的艺术关键词,以及一个大语言模型来编写一份完美的、人类可读的食谱。但他们并未止步于此。在第二步中,他们执行了一种特殊的“噪声反转”。这就像是倒带烘焙过程,以找到创造了该蛋糕独特结构的精确随机火花。
通过将完美的食谱与精确的火花相结合,Dualin 可以以惊人的准确度重现原始图像。作者在数千张图像上测试了该方法,发现其产生的人物图像与原图几乎一模一样,比以往的方法要好得多。他们还从数学上证明了这种技术可以实现精确的编辑。因为“火花”(噪声)承载着结构,而“食谱”(提示词)承载着意义,所以你可以通过改变食谱将猫换成狗或改变背景,而新图像将保持与原图完全相同的布局和光影。论文指出,这种双重方法是解锁真正可控且高质量图像编辑的关键,它超越了仅仅猜测单词,而是走向了理解这些图像是如何被制造出来的完整魔力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。