Consistent Feature Transport for Image Relighting
本文介绍了一致性特征传输(Consistent Feature Transport, CFT),这是一种基于修正流(rectified flow)构建的训练原理,它将图像重光照重新表述为照明特征传输问题,从而显式地强制源图像与目标图像之间保持一致的特征变换,进而实现比现有基于扩散的方法更优越的光照控制与内容保留能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位拥有魔法棒的数字艺术家,这根魔法棒可以改变任何照片中的光影。你想把一个阴沉、多雨的街道场景变成一幅阳光明媚、金辉灿烂的杰作,或者将一张人像从刺眼的办公室荧光灯转变为柔和浪漫的落日余晖。但问题在于,你并不想改变人的脸部、衣服或建筑物的形状。你只想移动光线。这就是“图像重光照”(image relighting)的挑战。在计算机科学领域,特别是生成式人工智能(Generative AI)这一领域,研究人员使用“扩散模型”(diffusion models)——可以将它们想象成极其聪明的艺术家,它们通过从一团杂乱的静态噪声开始,并逐渐将其精炼成一幅清晰的图像来学习绘画。虽然这些 AI 艺术家非常出色,但当被要求仅仅改变光线时,它们有时会显得力不从心。它们可能会不小心改变人的发色、扭曲脸部,或者让阴影看起来像是属于另一个星球。大问题在于:我们该如何教 AI 在不弄乱其他一切的情况下移动光线呢?
本文介绍了一种名为“一致性特征传输”(Consistent Feature Transport, CFT)的新技巧,正是为了解决这个精确的问题。作者们(来自北京理工大学、美图公司和中国人民大学的一个团队)意识到,以往的方法试图去“猜测”如何改变光线,这往往会导致不一致或混乱的结果。相反,他们决定教 AI 一种在原始照片与重光照照片之间的特定“舞蹈”。他们不仅将重光照视为在图像上重新绘画,而是将其表述为一个精确的“特征传输”问题。想象一下,你有两个完全相同的粘土雕塑,但其中一个被红灯照射,另一个被蓝灯照射。目标是教 AI 如何将第一个雕塑的“红光”特征转移到第二个雕塑上,而不挤压粘土本身。
为了实现这一点,研究人员构建了一个包含 34,695 对人像图像对的大规模新数据集,其特点是涵盖了从霓虹灯到柔和晨光的各种复杂且多样化的场景。随后,他们使用一套特殊的“三部分规则手册”来训练他们的 AI。首先,他们教 AI 如何从噪声中生成图像(这是标准做法)。第二,他们确保 AI 能够完美地重建原始图像(这样它就不会忘记那个人长什么样)。但真正的“秘密配方”是第三条规则:他们强迫 AI 去学习两个具有相同光影变化但具有不同人物的图像之间的“传输”。这就像是给 AI 看一张人在红光下的照片,然后再看一张不同的人在同样红光下的照片,然后告诉它:“搞清楚光线是如何从第一个人转移到第二个人身上的,并将这个完全相同的动作应用到这张新照片上。”通过这种方式,AI 学到了“移动光线”是一个特定的、一致的行为,它与“改变脸部”是相互独立的。
结果非常令人振奋。当他们用这种新方法与其它顶尖 AI 工具进行对比测试时,他们的方法始终能产生更好的结果。在数据方面,他们的最佳模型实现了 0.9202 的结构相似性指数(SSIM)和 23.5105 的峰值信噪比(PSNR),这些分数高于大多数竞争对手,这意味着脸部更贴近原貌,且光影效果更真实。他们还发现,这个技巧不仅仅适用于光照;当他们尝试将其用于“风格迁移”(将照片变为画作风格)时,它同样奏效,这表明这种“特征传输”的思想是许多类型图像编辑的强大工具。作者们建议,通过明确教导 AI 如何在保持其他特征(如身份)稳定的同时移动特定特征(如光线),我们可以使数字编辑变得更加可靠,且不易出现奇怪的故障。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。