← 最新论文
💻 computer science

HM-Talker: Hybrid Motion Modeling for High-Fidelity Talking Head Synthesis

HM-Talker 是一种新颖的音频驱动说话人头部合成框架,它通过交叉模态映射模块和采用随机特征配对的混合运动建模模块,将显式发音线索与隐式韵律特征协同整合,从而解决了个性化与泛化之间的权衡问题。

原作者: Shiyu Liu, Kui Jiang, Junjun Jiang, Xianming Liu, Xiaocheng Feng, Hongxun Yao, Qi Tian

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Shiyu Liu, Kui Jiang, Junjun Jiang, Xianming Liu, Xiaocheng Feng, Hongxun Yao, Qi Tian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要创建一个只需聆听语音录音就能说话的数字化身。你希望这个化身看起来像某个特定的真人(个性化),同时又能说出任何句子,甚至是那个人从未说过的句子(泛化能力)。

长期以来,计算机科学家在面对这一问题时都陷入了“二选一”的困境:

  1. “自由风格”方法:如果仅让计算机根据声音猜测口型动作,化身或许能说得不错,但其面部往往显得摇晃、扭曲,或像是在出现故障。它缺乏稳固的骨架。
  2. “严格规则”方法:如果强制计算机遵循严格的解剖学规则(例如面部的 3D 模型),动作会保持稳定,但化身最终看起来会像个机器人,面部僵硬、呆板,无法表达情感或适应新的声音。

HM-Talker 是一项新解决方案,它就像一位将两种不同食谱融合的大厨,以兼得两者之长。以下是其工作原理,拆解为简单的概念:

1. 两种原料(问题所在)

想象一下计算机通常尝试制作说话头像的两种主要方式:

  • 隐式特征(“耳朵”方法):这种方法聆听音频并猜测口型。它擅长捕捉语音的节奏情感,但不擅长准确判断嘴唇应如何物理闭合。这就像仅通过听人说话来画脸:你能感受到神韵,但细节可能出错。
  • 显式特征(“眼睛”方法):这种方法观察人物的视频,并利用严格的几何规则(如动作单元,即类似肌肉代码的编码)来驱动面部。它擅长保持面部看起来真实且稳定,但过于僵化。如果你试图让它用新的声音说话,它会感到困惑并显得僵硬。

2. 解决方案:混合厨房

作者构建了一个名为HM-Talker的系统,完美地混合了这两种原料。他们使用了两个主要工具:

工具 A:“翻译器”(跨模态映射模块)

想象你有一位既懂“音频”又懂“视觉”的翻译。

  • 系统接收声音(音频),并询问翻译器:“如果这种声音是口型动作,它会是什么样子?”
  • 翻译器将声音转换为与该人物独特面部相匹配的视觉“食谱”(显式特征)。
  • 这确保了即使计算机仅聆听音频,它也有一个稳固的解剖学“地图”可循,从而防止面部摇晃。

工具 B:“智能混合器”(混合运动建模模块)

这是最巧妙的部分。想象一位正在学习烹饪某道菜的厨师。与其只遵循一种食谱,这位厨师同时练习两种不同的烹饪方式,并随机切换:

  • 练习 1(个性化):厨师同时查看原始人物的视频和音频。这教会系统:“这就是这个特定的人移动嘴唇的确切方式。”
  • 练习 2(泛化):厨师仅查看音频和“翻译”后的视觉食谱,忽略原始视频。这迫使系统学习:“仅凭这种声音,我该如何让任何人的嘴唇正确移动?”

通过在这两种“练习”之间随机切换(他们称之为随机特征配对的策略),系统学会了既能完美模仿特定人物,又能灵活地用任何新声音说话。

3. 结果:流畅、逼真的表现

当系统完成训练后,它既不只是猜测,也不只是遵循规则。它使用一个智能门控来决定,对于视频的每一帧,应多大程度上信任“声音猜测”与“解剖学规则”。

  • 如果声音清晰:它信任音频来增添情感和节奏。
  • 如果声音棘手:它依赖解剖学规则来防止嘴唇出现故障。

为何这很重要(根据论文所述)

论文声称,这种方法解决了“摇晃的脸”与“机器人脸”之间的两难困境。

  • 更好的同步:嘴唇在声音发生时精确移动,没有抖动。
  • 更好的真实感:面部看起来像真人,而不是扭曲的 3D 模型。
  • 多功能性:它可以提取一个人的视频,并让该人用完全不同的人(甚至是不同性别)的声音说话,而面部不会显得破碎。

简而言之,HM-Talker 就像给一位数字演员提供剧本(音频)和戏服(解剖学规则),然后由一位教练对其进行训练,在“做你自己”和“成为任何人”之间切换,使其能在任何情况下完美表演。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →