← 最新论文
⚡ electrical engineering

Integrating Human Linguistic Insights into AI: Theory-Driven Representation for Multilingual Text-to-Speech

本文证明了将理论驱动的音系表示——特征欠定词典(Featurally Underspecified Lexicon, FUL)集成到改进的 FastSpeech 架构中,能够为母语、非母语及语码混合语音实现具有可扩展性、可解释性且高质量的多语言文本转语音合成,即使在训练数据有限的情况下也是如此。

原作者: Cong Zhang, Huinan Zeng, Huang Liu, Jiewen Zheng

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Cong Zhang, Huinan Zeng, Huang Liu, Jiewen Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人说地球上的每一种语言。目前,实现这一目标最流行的方法就像是喂给一个巨大的、饥肠辘辘的怪物数百万小时的人类对话。机器人吞噬所有这些数据,记住这些声音,最终学会说话。对于英语或普通话这类拥有大量说话者的语言,这种方法效果惊人;但对于较小的语言来说,这是一个巨大的问题——那里没有足够的小时数供机器人“进食”,而且为每一种语言都建立一个单独的“怪物”既昂贵又浪费。

但人类却不同。我们不需要数百万小时来学习一个新声音;我们只需要理解基本的构建模块。语言学家们花费数十年研究这些模块,称之为“音系特征”(phonological features)。把它们想象成不是具体的字母或声音,而是构成一种声音的微小开关。这个声音是用嘴唇发出的吗?(这就是一个“唇音”开关)。空气是自由流动的,还是被阻挡了?(这是一个“辅音”开关)。声带在振动吗?(这是一个“浊音”开关)。人类并不把“cat”这个词作为一个巨大的、不可分割的块来记忆,而是将其分解为这些开关:嘴唇、气流阻断、振动、舌位高度等等。这项研究提出了一个简单而大胆的问题:如果我们教机器人使用这些微小的开关,而不是整个单词或声音来说话,会怎样?机器人能否仅仅通过理解这些开关的规则,就能学会一种它从未听过的语言?

这项研究背后的研究人员决定使用一组特定的开关——即“特征欠定词库”(Featurally Underspecified Lexicon, FUL)来测试这个想法。他们想看看是否可以利用极少的数据,构建一个既能说英语又能说普通话,甚至能将两者混合在一起的语音机器人。他们并没有试图建造世界上最大、最完美的机器人,而是建立了一个概念验证,以观察这种“基于开关”的方法是否真的可行。

以下是他们的做法和发现。他们采用了一个标准的语音机器人(基于名为 FastSpeech 的架构),并用这些 FUL 开关替换了它通常使用的输入——即像“p”、“b”或“t”这样的特定声音符号。他们教机器人将标准的语音符号转化为这 20 个通用的开关。然后,他们进行了两个实验。

在第一个实验中,他们给了机器人极少量的数据:仅 2.62 小时的英语和 0.5 到 8 小时之间的普通话。他们要求机器人同时使用这两种语言,尽管那位英语说话者从未听过普通话,而那位普通话说话者也从未听过英语。结果喜忧参半,但呈现出明显的趋势。当机器人拥有 8 小时的普通话数据时,该机器人可以产生可理解的普通话语音。更有趣的是,当英语说话者尝试说普通话(一种他从未接受过训练的语言)时,机器人能够产生一些可以理解的声音,尽管听起来带有一种口音。机器人并没有神奇地变得流利,但它表明,这些开关让它能够对从未听过的声音进行猜测。

在第二个实验中,他们给了机器人更丰盛的“饮食”:来自 12 位说话者的 100 小时数据,包括英语和普通话。这一次,结果要强得多。机器人可以清晰地表达两种语言。甚至那位完全没有英语训练数据的普通话说话者,也能说出足以让人理解的英语。英语说话者在说普通话时,也比之前清晰得多。机器人不仅仅是在模仿;它正在利用共享的开关来弄清楚如何发出新的声音。例如,当英语机器人尝试发出一种它从未听过的特定普通话声音时,它利用从其他声音中学到的“开关”来构建出一个接近该声音的版本,从而达到足以被理解的效果。

然而,论文谨慎地指出,这并不意味着什么。机器人并没有变成完美的真人说话者。它在处理语言的“音乐性”方面仍然存在困难,特别是普通话中的声调。因为机器人没有被教授如何使用声调(如升降调)的开关,所以英语说话者听起来像是用平淡、中性的语调在说普通话,这使得某些词汇难以理解。研究人员建议,虽然“开关”在处理单个声音(辅音和元音)方面表现出色,但我们仍需研究如何为语音的音乐部分添加开关。

那么,核心结论是什么?这项研究表明,使用这些通用的语言学开关是一种可行且数据高效的方法,可以用来教机器人说多种语言。它证明了你不需要数百万小时的数据来让机器人学会一门新语言;你只需要教会它游戏的规则。虽然这目前还不是一个完美的解决方案——尤其是在处理像声调这样的音乐性部分时——但它为构建针对小型、低资源语言的语音技术打开了大门,而无需录制数十年的音频。这是迈向这样一个世界的一步:在这个世界里,机器人可以通过理解其“DNA”来学习一门新语言,而不是仅仅通过死记硬背其历史。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →