想象一下这样一个世界:你的数字照片可以瞬间让你变回蹒跚学步的幼儿、青涩的少年,或是睿智的老者,同时还能让你那张脸依然清晰可辨,一眼就能认出是你自己。这不仅仅是社交媒体上的一个魔术把戏;它还是侦探寻找失踪儿童、安全专家测试身份识别系统有效性,以及电影制作人跨越时空讲述故事的严肃工具。为了实现这一目标,科学家们使用了一种被称为“生成式人工智能”(Generative AI)的技术,具体来说是一种被称为 GAN(生成对抗网络)的模型。把 GAN 想象成一位记住了数百万张面孔的超级聪明的艺术家。在这个艺术家的脑海中,有一个被称为“潜空间”(latent space)的隐藏“控制室”。如果你在这个房间里移动滑块,艺术家就会改变一张脸的发色或笑容。但通过移动滑块来改变一个人的年龄却非常棘手。如果你推得太猛,这张脸可能会变成另一个人,就像变色龙变换颜色过快一样,从而丢失了原本的身份特征。目前大多数方法试图为每一个年龄段都教给艺术家新的规则,这就像是强迫一位画家为人类生活的每一个十年都学习一种新的语言。这种方式既缓慢又昂贵,而且经常导致生成的面孔看起来虚假或难以辨认。
本文介绍了一种巧妙的捷径,让我们无需重新训练艺术家即可实现面部的老化或减龄。研究人员 Luis S. Luevano、Pavel Korshunov 和 Sébastien Marcel 发现了一种在流行的 AI 模型 StyleGAN2 现有的“控制室”中进行导航的方法。他们并没有教给 AI 新的规则,而是找到了隐藏空间中一个对应于变老或变年轻的具体方向。想象一下,潜空间是一张巨大的多维地图。该团队使用了一个简单的数学工具(支持向量回归器)在这张地图上画出了一条从“年轻”指向“年老”的直线。通过让面孔沿着这条线滑动,他们可以让面孔看起来更老或更年轻。
问题陈述 利用生成式 AI 进行面部老化与去老化在取证、安全和媒体应用中至关重要。然而,最先进的方法通常依赖于条件生成对抗网络(Conditional GANs)、扩散模型(Diffusion models)或视觉语言模型(Visual Language Models),这些方法需要复杂的训练过程、大量的标注数据集以及特定的调节条件(例如目标年龄标签或文本提示)。这些方法往往难以实现可控性,并且至关重要地,无法保证身份保持(identity preservation)。现有的身份保持机制通常依赖于嵌入在损失函数中的单一人脸识别模型,这会引入偏差,并限制了输出在不同识别系统中的鲁棒性。此外,如何在保持身份不退化的前提下,在 GAN 的连续潜空间中寻找一致的“年龄方向”,仍然是一个重大挑战。
方法论 作者提出了一种高效的数据驱动策略,直接在预训练 StyleGAN2(具体为 W 空间)的潜空间内进行操作,避免了重新训练生成器或编码器的需求。该方法由三个核心部分组成:
基于支持向量回归(SVR)的线性潜空间编辑: 不同于训练新的网络,作者将真实面部图像投影到 StyleGAN2 的 W 潜空间中。他们采用线性支持向量回归器(SVR)来拟合一个超平面,将潜向量 (w~) 与其对应的年龄标签 (y) 进行映射。通过将 SVR 参数投影到潜向量上,他们推导出一个归一化的单位向量 (λ^),代表全局“年龄合成方向”。老化或去老化是通过沿着该方向移动一个标量步长 s 来实现的: w1=w0+sλ^ 为了将标量 s 映射到特定的目标年龄(岁),作者通过拟合标量步长与估计表观年龄之间的多项式曲线,从而能够计算出任何目标年龄变换所需的精确标量偏移量 (Δs)。