← 最新论文
⚡ electrical engineering

A Situational Speech Synthesizer for Yoruba: System Design, Phonological Rule Architecture, and Orthographic Extensions for Contour

本文介绍了 TTSYoruba,这是一种用于约鲁巴语的基于规则的拼接双音素语音合成器,它利用手工构建的音系规则系统,从带有声调标记的文本中生成音频,解决了复杂的鼻音和声调歧义问题,并引入了用于轮廓调的标准化正字法标记。

原作者: Kola Tubosun, Adedayo Oluokun, Hafiz Adewuyi, Dadepo Aderemi

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Kola Tubosun, Adedayo Oluokun, Hafiz Adewuyi, Dadepo Aderemi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

文字的音乐:教计算机如何歌唱约鲁巴语

请将语言想象成一首歌。在许多语言中,旋律是隐藏的;你可以改变声音的音高,单词的意思可能会发生变化,但书写出的字母却保持完全一致。但在西非广泛使用的约鲁巴语(Yorùbá)中,旋律直接被写在了音符里。这种语言使用“声调”——高音、低音以及上升或下降的音高——来准确告知你一个词的含义。如果你写错了音符,你可能会不小心把“狗”说成“狮子”。这使得约鲁巴语成为了一个独特的计算机难题。通常,当我们要求计算机朗读文本时(这种技术被称为“文本转语音”或 TTS),机器必须根据它从数千小时的人类语音中学习到的模式来“猜测”旋律。但对于像约鲁巴语这样“乐谱”已经写在文本中的语言,我们不需要计算机去猜测。我们只需要一个能够完美阅读这些音符的计算机。

故事在这里变得有趣起来。长期以来,计算机在说出自然流畅的约鲁巴语方面一直很吃力,因为它们缺乏足够的人类录音供其学习。它们就像一位试图在没有乐谱的情况下仅凭听觉学习复杂歌曲的音乐家,经常节奏出错。但如果我们建造一个不需要猜测的机器人音乐家呢?如果我们给它一个包含人类录制的每一种可能的音符组合的图书馆,并给它一套严格的规则来确定下一步该演奏哪个音符呢?这就是一组研究人员所解决的挑战,他们想要为大规模在线约鲁巴语姓名词典构建一个声音。他们需要一个系统,能够接收一个书写的名字,计算出精确的音高和节奏,并立即将其大声说出来,而不需要人类去录制世界上每一个名字。

机器人合唱团与规则的魔力

这篇论文介绍了一种名为 TTSYoruba 的聪明、基于规则的机器人声音,它是专为约鲁巴语设计的。不要把这个系统看作是一个通过倾听来学习的大脑,而要把它看作是一个拥有巨大预录音频剪辑库的、组织极其严密的图书管理员。研究人员录制了一个人类声音说出每一种辅音和元音的所有可能组合(例如“ba”、“de”、“go”)在五种不同音乐声调下的情况。他们最终得到了一个包含 651 个微小声音剪辑的库。

魔力发生在规则中。当你输入像 Adébọ̀wálé 这样的名字时,计算机并不仅仅是按顺序播放剪辑。它扮演着指挥家的角色。它会观察字母上方的音符(声调符号),并检查它之前的音符。在约鲁巴语中,一个音符的音高通常取决于它之前的音符。如果一个低音后面跟着一个高音,那个高音可能会实际“向上滑动”,听起来像是一个上升的音调。系统有一条特定的规则:如果它看到一个高音出现在一个低音之后,它会将标准的“高音”声音剪辑替换为一个特殊的“上升”声音剪辑。它对下降音调也是如此。通过遵循这些严格的音乐规则,计算机将这些剪辑缝合在一起,使其听起来像是一句流动的句子,而不是机器人在点击舌头。

破解“N”之谜

这个谜题中最棘手的部分是字母 n。在约鲁巴语中,字母 n 是一个变形者。有时它是在单词开头的辅音(如 nọ́);有时它是一个独立的音节(如 ń);有时它根本不是一个声音,而是一个标记,告诉你在它之前的元音是“鼻音”(通过鼻子发声)。对于计算机来说,这看起来像是一堆完全相同的字母造成的混乱。

研究人员构建了一个“鼻音消歧”(Nasal Disambiguation)系统来解决这个问题。它就像一个提出三个问题的侦探:

  1. n 上方是否有音符?如果有,它是一个独立的音节。
  2. n 是否位于特定的元音(如 iu)之间?如果是,它是一个鼻音标记,计算机需要改变它之前元音的发音。
  3. 它是否只是一个普通的辅音?如果是,则将其视为下一个声音的开头。

通过应用这些规则,该系统可以正确发音那些否则会听错的名字,区分了鼻化元音和音节性的 n

新的音乐记谱法:加符号与抑扬符

在这里,论文提出了一个大胆且富有创造性的举措。研究人员发现了一个问题:有些名字在单个元音上具有“轮廓音”(即上下起伏的音高),但约鲁巴语传统的写法是双写元音(如 Níkẹ̀ẹ́)。这对许多母语使用者来说看起来很奇怪,也感觉很笨重。

团队提出了一种新的表达方式,使用计算机键盘上已存在但尚未用于标准约鲁巴语书写的符号:加符(一个像 ǎ 这样的小钩)表示上升音调,以及抑扬符(一个像 â 这样的小帽子)表示下降音调。

可以这样理解:与其将一个长长的、双音符的和弦写成两个单独的键,不如按下一个带有特殊“帽子”的键。计算机知道 ǎ 意味着“播放上升的声音剪辑”,而 â 意味着“播放下降的声音剪辑”。这使得人们可以按照常用的拼写方式输入名字,而不会出现奇怪的双元音,同时仍能获得完美的音乐音高。研究人员通过要求 50 人分别聆听以旧有的“双元音”方式和新的“帽子”方式书写的名字进行了测试。结果如何?听众无法分辨两者的区别。他们认为两个版本同样自然且易于理解。事实上,一些听众甚至更喜欢新的“帽子”版本,因为它看起来更符合他们在脑海中看到的单词形式。

结论:良好的开端,但并不完美

团队通过 50 名志愿者测试了他们的系统,每人聆听 10 个不同的名字。结果令人鼓舞但也非常诚实。计算机在“可理解性”方面表现得非常出色,这意味着每个人都能准确知道正在说的是哪个词。然而,“自然度”得分稍低。听众描述这个声音听起来有点慢,就像老师在给全班同学讲课一样,而不是像朋友在闲聊。这是因为系统是将微小的剪辑缝合在一起的,每个音节之间都有一个微小且不自然的停顿。

论文非常明确地说明了它没有做的事情。它无法处理具有复杂节奏的长句子或整个段落中音高的变化。它是专门为短名字设计的。它还依赖于用户输入正确的声调标记;如果你在输入时不带这些标记,机器人将无法得知旋律。

最终,这篇论文表明,对于那些音乐属性已经写下来的语言,我们不需要庞大的 AI 大脑来学习歌曲。我们只需要一个拥有良好规则的聪明图书管理员。该系统证明了基于规则的方法可以处理约鲁巴语复杂的音乐性,而新的“帽子”和“钩子”符号提供了一种实用且兼容键盘的方式,可以在不改变人们拼写习惯的同时,实现精准的音乐音高。这是一个坚实的、可运行的基础,可以帮助未来构建更好的语音。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →