UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos
UniSwap 是一个新颖的框架,它通过利用单个扩散 Transformer 以及一种“交换与重构”训练流水线和高效采样技术,实现了说话视频中首次流式的音视频同步身份替换,从而实现同步、一致且稳定的长时程生成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在看电影,但屏幕上的演员突然开始用另一种声音说话,而且看起来完全变成了另一个人,尽管他们说的还是完全相同的台词,且唇形与语速完美同步。这就是谈话类视频中“身份交换”(identity swapping)的梦想。长期以来,计算机一直擅长完成这项技巧中的某一部分:要么在保留原声的同时改变一个人的脸,要么在保留原脸的同时改变声音。但试图同时完成这两者,就像是尝试在骑单轮车的同时抛接两个不同的球;结果往往不同步,要么嘴型对不上词,要么声音听起来像机器人。本文深入探讨了生成式人工智能的世界,特别是研究我们如何教计算机同时交换一个人的外貌和声音,且实现实时处理,而不让视频出现卡顿或音频滞后。
开发 UniSwap 的研究人员构建了一个全新的系统,它就像一位大师级的木偶操纵师,在同一时刻同时拉动视频视觉和音频两端的丝线。他们并没有使用两个独立的工具——一个用于面部,一个用于声音——而是创建了一个单一的“大脑”,这个大脑将一个人的面部动作和声音表现理解为一个连贯的整体体验。这就像一位双语翻译员,不仅能翻译文字,还能瞬间捕捉说话者的口音和面部表情。
论文介绍了一种巧妙的方法来训练这个系统。由于几乎不可能找到现实生活中同一个人在看起来和听起来都是两个不同人的情况下说同样台词的真实视频,团队发明了一个“交换并重建”(swap-and-reconstruct)的游戏。他们获取一段真实的视频,在数字层面剥离这个人的脸和声音,从而创造出一个“幽灵”版本,然后要求 AI 以一个新的脸和声音作为引导来重建原始视频。这就像是给厨师一张空白画布和一份食谱,然后要求他们完美地还原一道特定的菜肴。通过在数百万个这样的“重建”案例上进行训练,AI 学会了如何在保持原始动作和背景完整的同时进行身份交换。
真正特别之处在于,它的运作方式更像是一场直播,而不是一部缓慢的预录电影。大多数视频生成器必须看完整个片段后才能开始绘制第一帧,这对于交互式使用来说太慢了。然而,UniSwap 以“传送带”的方式,将视频分成小块进行生成,这使得它在高性能计算芯片(NVIDIA H100)上能够产生约每秒 13.6 帧的图像。虽然这还不足以实现真正的即时实时交互,但这是一个巨大的飞跃,它允许系统生成长达一小时的长视频,而不会出现角色面部或声音随时间推移而发生漂移或扭曲。作者发现,通过使用一种被称为“特征 RoPE 分解”(Feature-RoPE Decomposition)的特殊“记忆技巧”,AI 可以在生成数千帧后依然记住原始身份,确保角色从第一秒到最后一秒都保持一致。
简而言之,UniSwap 表明我们终于可以拥有一个统一的系统,在谈话类视频中同时交换外貌和声音,并实现高度的同步性和稳定性。虽然当前版本还不够快,无法进行实时的现场对话(略慢于标准视频播放的速度),但它证明了单个模型在处理这两项任务时,比尝试将两个独立的系统缝合在一起的效果更好。结果显示,唇动与新声音保持完美同步,且即使在长视频中,角色的身份也保持稳定,这为更自然、更具交互性的数字虚拟人提供了充满前景的一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。