← 最新论文
💻 computer science

SyncAnyone: Implicit Disentanglement via Progressive Self-Correction for Lip-Syncing in the wild

本文提出了 SyncAnyone,这是一个新颖的两阶段框架,它将基于扩散模型的掩码修复模型与随后的无掩码自校正微调流水线相结合,旨在实现高保真、音频驱动的唇形同步,同时在野外场景中保持身份和背景的一致性。

原作者: Xindi Zhang, Dechao Meng, Steven Xiao, Qi Wang, Peng Zhang, Bang Zhang

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Xindi Zhang, Dechao Meng, Steven Xiao, Qi Wang, Peng Zhang, Bang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一段人说话的视频,但你想改变他们所说的话,以匹配一段新的音频轨道(比如把电影配音成另一种语言)。目标是让他们的嘴唇动作完美地契合新的词句,同时不改变他们的脸部、背景,也不让视频看起来很奇怪。

长期以来,AI 研究人员一直试图解决这个问题,使用的是一种“数字模板”。以下是旧方法是如何运作的,以及为什么这篇论文中被称为 SyncAnyone 的新方法是一个游戏规则改变者。

旧方法:“模糊模板”问题

想象一下,你正试图在一张照片上画一个新的嘴巴。旧的 AI 方法会拿一段胶带(掩码/Mask)遮住人的嘴部及其周围区域。然后,AI 会尝试根据声音来猜测嘴巴应该是什么样子,同时努力保持脸部的其余部分可见。

论文解释说,这种方法有一个巨大的缺陷:

  • 如果胶带太小: AI 会“作弊”。它会通过观察下巴或脸颊来猜测嘴部动作,而不是真正去听音频。
  • 如果胶带太大: AI 会感到困惑。它会不小心把人的身份特征或背景场景也涂抹掉,导致视频看起来模糊或扭曲,尤其是在人转头或场景快速切换时。

这就像试图通过在房间的一大片区域涂漆来修补墙上的一个洞;你可能修好了洞,但却毁掉了旁边的壁纸和家具。

新方法:SyncAnyone 的“两步自我修正”

论文作者提出了一种名为 SyncAnyone 的新框架。他们没有依赖于一次性且不完美的尝试,而是使用了一个**两阶段的“渐进式自我修正”**过程。把它想象成一位艺术家,先画出一份草图,然后再将其精炼成杰作。

第一阶段:“草稿”画家

在第一阶段,AI 扮演着一名技术娴熟但略显粗糙的画家。

  • 它使用旧的“模板”方法(遮盖嘴部)来学习如何根据声音准确地移动嘴唇。
  • 因为它使用了模板,它能掌握正确的嘴唇动作,但可能会在嘴部边缘或背景处留下一些“污迹”或奇怪的人造痕迹(Artifacts)。
  • 神奇的技巧: 研究人员随后教这个“草稿”AI 自行生成数千个练习视频。它获取一段视频,改变音频,并创建一个新版本——其中嘴唇动作发生了变化,但视频的其他部分保持不变。

第二阶段:“完美主义”编辑

现在到了聪明的部分。研究人员提取出这个“草稿”AI 及其制作的练习视频,并训练第二个 AI(第二阶段)来修复错误。

  • 设定: 他们向第二个 AI 展示一段“受损”的视频(即第一阶段带有污迹的视频)和一段“完美”的原视频。
  • 教导: 他们告诉第二个 AI:“你的任务是观察这段混乱的视频,听这段新的音频,并且修复嘴部。你必须让背景和这个人的脸部与原视频完全保持一致。”
  • 结果: 因为 AI 必须“清理”这些污迹,它学会了忽略背景,并专注于嘴唇。它学会了将移动的嘴部与静态的脸部进行“解耦”(Disentangle)。

通过这个过程,第二个 AI 不再需要那个“模板”(掩码)。它准确地知道哪些像素属于嘴唇,哪些像素属于背景,从而能够在不模糊场景的情况下进行修改。

为什么这很重要(根据论文所述)

论文声称,这种新方法比以往的方法更能处理现实世界的复杂情况。具体而言:

  • 大幅度转头: 即使人在侧头(这是旧方法经常失败的地方),它依然有效。
  • 障碍物: 如果有人把手放在脸前,AI 会保留那只手,只移动手背后的嘴唇。
  • 场景切换: 如果视频切换到了不同的背景,AI 不会感到困惑;它能保持新背景清晰锐利。
  • 身份特征: 视频中的人看起来仍然是他们自己,而不是一个模糊的版本。

总结

SyncAnyone 就像是一个两步走的编辑过程:

  1. 第一步: 使用“辅助轮”(掩码)教 AI 如何移动嘴唇,即便这会在边缘产生一些错误。
  2. 第二步: 让 AI 通过练习来修复自己的错误,直到它学会完美地编辑嘴唇,而不再需要辅助轮,也不会弄乱背景。

其结果是一个更快速、更清晰,并且能在以往 AI 工具失效的情况下依然正常工作的视频配音工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →