ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis
本論文は、オーディオブックからスケーラブルなパイプラインを介して構築された、2,200 時間のマルチスピーカー・ペルシア語音声コーパスである ParsVoice を紹介するものであり、これはオープンなペルシア語 TTS リソースを大幅に拡張し、XTTS モデルの微調整に使用された際に高品質な合成性能を示す。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットにペルシャ語を話させることを想像してみてください。単に辞書を渡すだけでは不十分です。物語を読み上げる実際の人間の声を数千時間分与え、言語のリズム、感情、そして独特の音を学習させる必要があります。
長らく、ペルシャ語は巨大なパーティーに招かれたが、テーブルに席を与えられなかったゲストのようでした。英語のような言語には録音された音声の膨大なライブラリ(巨大で整理された倉庫と想像してください)が存在する一方で、ペルシャ語には非常に少ないものでした。これにより、ペルシャ語話者のための優れた音声アシスタントや物語を語るロボットを構築することが困難でした。
解決策:ParsVoice
この論文の著者たちは、本質的にペルシャ語音声の巨大で高品質なライブラリである「ParsVoice」を構築しました。これはこの言語のために作られた史上最大の公開コレクションです。
彼らがどのように行ったか、簡単なステップに分解して説明します。
1. 原材料:オーディオブック
スタジオで俳優に台本を読ませる(これは高価で時間がかかります)代わりに、チームは『IranSeda』と呼ばれるオーディオブックの公共ライブラリを利用しました。これは、未編集のフィルムリールの山を見つけるようなものです。彼らは 3,800 冊以上の本を持っていましたが、一つ問題がありました。音声と完全に一致する書き起こしテキスト(トランスクリプト)がなかったのです。
2. 「スマートカッター」パイプライン
10 時間ものオーディオブックファイルをそのままロボットに与えることはできません。それは完璧な小さな文に細かく切り分けられる必要があります。チームはこれを行うための自動化された「工場ライン」を構築しました。
- ラフカット: コンピュータプログラムを使用して、文と文の間の無音部分を見つけ、そこで音声を切断しました。
- 「終わったか?」チェック: 時には、コンピュータが文の途中で音声を切断してしまうことがあります(まるで「愛してる」と言う直前のヒーローの映画を止めるようなものです)。彼らは「ParsBERT」というモデルに基づくスマートな AI を使用してテキストを読み、「これは完全な思考か?」と問いかけました。答えが「いいえ」の場合、システムは自動的に切断位置を数秒延長し、文が完結するまで再度確認しました。
- 「脂肪を削る」ステップ: 切断した後でも、クリップの最初や最後にわずかな無音や咳が含まれている可能性があります。システムは「二分探索」(推測と確認を巧みに繰り返す方法)を使用して、言葉を削り落とすことなく、無音を正確に適切な量だけ切り取り、声がきれいに始まり、終わるようにしました。
- 品質検査官: すべてのオーディオブックが防音スタジオで録音されているわけではありません。背景音楽や不良マイクが含まれているものもあるかもしれません。システムは厳格な編集者のように振る舞い、各クリップの音声の明瞭さとテキストの正確性をスコア付けしました。クリップがノイズが多すぎたり、テキストが意味不明だったりする場合、それは廃棄されました。
- 音声探偵: 一つのオーディオブックに複数のナレーターがいる可能性があるため、システムは「音声指紋」ツールを使用して、誰が話しているかによってすべてのクリップをグループ化しました。これにより、1,815 人の異なる話者を自動的に特定することができました。
3. 結果
最終製品は、クリーンで完璧に切り分けられたペルシャ語の文の2,200 時間に及ぶライブラリです。
- 以前の最大のペルシャ語音声コレクションの25 倍の規模です。
- 136 万個の個々の文のクリップが含まれています。
- 1,815の異なる声をカバーしています。
4. 機能しましたか?
このライブラリが実際に有用かどうかをテストするために、チームはこの新しいデータのみを使用して、最新の AI 音声モデル(XTTS と呼ばれる)を学習させました。ペルシャ語の文字の音(音素)を最初に教えるのではなく、テキストと音声から直接学習させました。
結果は印象的でした。
- 自然さ: 人間はロボットの声を非常に自然だと評価しました(5 点満点中 3.6 点)。
- 音声の模倣: ロボットに聞いたことのない新しい声を真似させるよう求めたところ、非常にうまくできました(5 点満点中 4.0 点)。
- 明瞭さ: ロボットは明確に話し、他のコンピュータプログラムが完全に理解できるほどでした。
何ができないか(限界)
著者たちは、このライブラリが何ではないかについて正直に述べています。
- チャット用ではない: データはオーディオブックから来ているため、声は物語を読んでいるように聞こえます(形式的で一定です)。コーヒーショップで友人同士が casual でテンポよく会話するようにロボットに求めると、少し堅苦しく聞こえるかもしれません。
- 完璧ではない: 元の書籍がなかったため、テキストをコンピュータに推測させざるを得なかったため、テキストにはいくつかの小さな誤りがありますが、それらの大部分はフィルタリングされました。
- 性別のバランス: 使用したオーディオブックに男性ナレーターが多かったため、ライブラリには女性の声よりも男性の声の方が多く含まれています。
まとめ:
チームは、数千時間に及ぶ生のペルシャ語オーディオブックを、クリーンで整理された巨大なデータセットに変換する、巨大な自動化工場を構築しました。このデータセットは、より優れたペルシャ語音声技術を開発するために誰でも利用できるようになり、ついにこの言語に高度な音声研究のテーブルに席を与えることになりました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。