ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis
本文介绍了 ParsVoice,这是一个通过可扩展流程从有声读物构建的、包含 2200 小时多说话人波斯语语音的公开语料库,它显著扩展了开源波斯语语音合成资源,并证明在用于微调 XTTS 模型时具有高质量的合成性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想教一个机器人说波斯语。你不能只给它一本字典;你需要喂给它数千小时真实人类朗读故事的声音,让它学习语言的节奏、情感以及独特的发音。
长期以来,波斯语就像一场盛大派对中的一位客人,却未被安排在桌旁就座。而像英语这样的语言,则拥有庞大的录音语音库(不妨将其想象为巨大且组织有序的仓库),波斯语却鲜有此类资源。这使得为波斯语使用者构建优质的语音助手或讲故事机器人变得困难重重。
解决方案:ParsVoice
本文的作者们构建了ParsVoice,这本质上是一个大规模、高质量的波斯语语音库。它是迄今为止为该语言创建的最大公共同类收藏。
以下是他们如何实现这一目标的简化步骤:
1. 原材料:有声书
团队没有聘请演员在录音棚朗读剧本(这既昂贵又缓慢),而是转向了一个名为IranSeda的公共有声书图书馆。这好比发现了一座未经剪辑的原始胶片山。他们拥有超过 3,800 本书籍,但存在一个难题:他们没有与音频完美匹配的书面脚本(转录文本)。
2. “智能剪辑”流水线
你不能直接将一个 10 小时的有声书文件喂给机器人;它需要被切割成微小而完美的句子。团队构建了一个自动化的“工厂流水线”来完成这项工作:
- 粗剪:他们使用计算机程序寻找句子之间的静默,并在此处切割音频。
- “你结束了吗?”检查:有时,计算机会在句子中间切断音频(就像在英雄说出“我爱你”之前突然停止电影)。他们使用一种基于 ParsBERT 模型的智能 AI 来阅读文本,并询问:“这是一个完整的思想吗?”如果答案是“否”,系统会自动将切割点向后延长几分之一秒并再次检查,直到句子完整。
- “剔除冗余”步骤:即使切割后,片段开头或结尾仍可能残留极短的静默或咳嗽声。系统使用“二分查找”(一种巧妙的猜测与验证方法)来精确剪除适量的静默,使声音起止干净利落,而不切断任何词语。
- 质量检查员:并非所有有声书都在隔音录音棚录制。有些可能带有背景音乐或麦克风质量不佳。该系统充当严格的编辑,对每个片段的音频清晰度和文本准确性进行评分。如果片段过于嘈杂或文本是一派胡言,它就会被丢弃。
- 语音侦探:由于一本有声书可能包含多位叙述者,系统使用“语音指纹”工具将所有片段按说话者进行分组。这使得他们能够自动识别出 1,815 位不同的说话者。
3. 成果
最终产品是一个2,200 小时的波斯语句子库,这些句子经过清洗并完美切割。
- 它比此前最大的波斯语语音收藏大25 倍。
- 它包含136 万个独立的句子片段。
- 它涵盖了1,815 种不同的声音。
4. 它奏效了吗?
为了测试该库是否真正有用,团队仅使用这些新数据训练了一个现代 AI 语音模型(称为 XTTS)。他们并没有先教它波斯语字母的发音(音素),而是让它直接从文本和音频中学习。
结果令人印象深刻:
- 自然度:人类评估认为机器人的声音听起来非常自然(5 分制中得 3.6 分)。
- 声音匹配:当他们要求机器人模仿一个它从未听过的新声音时,它表现得非常出色(5 分制中得 4.0 分)。
- 可懂度:机器人说话清晰,其他计算机程序能够完美地理解它。
它不能做什么(局限性)
作者们诚实地说明了该库不是什么:
- 它不适合聊天:因为数据来自有声书,声音听起来像是在朗读故事(正式且平稳)。如果你要求机器人像咖啡馆里两个朋友那样进行随意、快节奏的聊天,它听起来可能会略显僵硬。
- 它并非完美:由于他们不得不使用计算机来推测文本(因为他们没有原始书籍),文本中存在少量微小错误,尽管他们已过滤掉了大部分。
- 性别平衡:该库中男性声音多于女性声音,仅仅是因为他们使用的有声书中男性叙述者更多。
总结:
团队建立了一个巨大的自动化工厂,将数千小时的原始波斯语有声书转化为一个干净、有序且庞大的数据集。现在,任何人都可以使用该数据集来构建更好的波斯语语音技术,终于让这门语言在高科技语音研究的殿堂中占有一席之地。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。