← 最新论文
💻 computer science

A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple Languages

该论文提出了多语言专家(MuEx),这是一个利用音素引导的混合专家架构和音素-视觉音素对齐机制来桥接视听模态的新型框架,旨在实现跨多种语言的高质量、同步的说话人面部合成,并具备强大的零样本泛化能力。

原作者: Zibo Su, Kun Wei, Jiahua Li, Jing Kong, Xu Yang, Cheng Deng

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zibo Su, Kun Wei, Jiahua Li, Jing Kong, Xu Yang, Cheng Deng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人讲故事。你给它一段语音录音,并希望它的数字脸部能完美地配合着单词进行唇动。这就是“说话脸部合成”(talking face synthesis)的世界——这是计算机科学的一个分支,机器通过它学习如何将音频转化为视频。长期以来,这些机器人就像是只能说一种语言(英语)的演员。如果你递给它们一段法语、中文或阿拉伯语的剧本,它们就会感到困惑。它们的嘴唇会动到错误的形状上,或者在声音说话时只是呆板地盯着前方,造成一种不协调的违和感。问题不在于机器人不会动,而在于它们只记住了英语发音的具体舞步,却并不理解发音的一般性通用规则。

为了解决这个问题,科学家们需要一种方法,能够将一个词的“声音”转化为嘴部的“形状”,而不被特定的语言所束缚。可以这样想:每种语言都有独特的音素(称为 phonemes),而每种声音都需要特定的嘴型(称为 visemes)。正如通用翻译机可以帮助人们交流不同语言一样,研究人员想要一个嘴部的“通用翻译机”,它能够理解任何语言的声音与形状之间的联系,无论是什么语言。这正是这篇论文所探讨的核心问题:我们如何构建一个能够自然地讲述任何语言的数字脸部,而不需要为每一种新语言都从头开始重新训练?

于是,由西安电子科技大学的研究人员提出的新框架 MuEx(多语言专家,Multilingual Experts)登场了,它充当了音频与视频之间的桥梁。MuEx 并没有强迫计算机去死记硬背成千上万种语言,而是教会系统去学习“嘴部的语言”本身。研究人员发现,虽然英语、中文和西班牙语听起来不同,但我们唇、齿、颌部运动的基本构建模块在所有语言中都惊人地相似。

MuEx 的秘诀在于一个巧妙的两部分系统。首先,它使用了一种“音素-唇形对齐”(Phoneme-Viseme Alignment)机制。想象一个巨大的图书馆,这里的每种声音都与完美的嘴型相匹配。MuEx 将来自各种语言的所有声音归类到几个通用的“声音桶”中,并将所有的嘴部动作归类到“形状桶”中。然后,它学习如何将这些桶进行匹配。这意味着系统不需要知道法语的“R”和德语的“R”之间的区别;它只需要知道两者都属于特定的声音桶,而该声音桶需要特定的形状桶。这解决了机器人在听到新语言时感到困惑的问题。

其次,MuEx 使用了“混合专家”(Mixture of Experts, MoE)策略,这就像是在厨房里拥有一支专业的厨师团队。当一个新的句子进来时,一个智能路由(主厨)会观察声音,并决定哪位特定的厨师(或“专家”)最适合烹饪这道菜。如果是一个来自中文这类声调语言的复杂声调,路由会将它发送给擅长此类动作的专家。如果是一个语速很快的英语句子,它会去往另一位专家那里。至关重要的是,这个路由不需要知道语言的名字;它只需观察声音模式并自动选择合适的专家。这使得系统能够处理它从未见过的语言,这种能力被称为“零样本泛化”(zero-shot generalization)。

为了证明其有效性,团队并没有仅仅依赖旧数据。他们构建了一个庞大的新数据集——多语言说话脸部数据集(MTFD),其中包含超过 95.04 小时的高质量视频,涵盖了 12 种不同的语言,范围从英语、西班牙语到泰语、越南语等声调语言。当他们将 MuEx 与其他顶尖方法进行对比测试时,结果显而易见。MuEx 在唇形同步准确度和自然度方面取得了最高分,击败了那些在相同数据上进行特定训练的模型。更令人印象深刻的是,当他们在从未见过的语言(如韩语、缅甸语和印地语)上进行测试时,MuEx 的表现仍然优于竞争对手,这表明其“通用嘴部语言”的方法确实奏效。

论文指出,通过专注于声音与形状之间的基本联系,而非死记硬背特定语言,我们可以创造出真正的多语言数字脸部。虽然该系统尚不完美(在视觉真实感方面仍有提升空间),但这项研究表明,这种新方法是一个重要的进步。它表明,未来说话脸部的关键不在于为每种语言构建一个新机器人,而是教会一个机器人人类说话的通用规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →