← Derniers articles
🤖 machine learning

ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis

L'article présente ParsVoice, un corpus de parole persan multi-locuteurs de 2 200 heures, disponible publiquement et construit via un pipeline évolutif à partir de livres audio, qui élargit considérablement les ressources TTS persanes ouvertes et démontre des performances de synthèse de haute qualité lorsqu'il est utilisé pour affiner le modèle XTTS.

Auteurs originaux : Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

Publié 2026-05-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous voulez enseigner le persan à un robot. Vous ne pouvez pas simplement lui donner un dictionnaire ; vous devez lui faire écouter des milliers d'heures de voix humaines réelles lisant des histoires, afin qu'il puisse apprendre le rythme, l'émotion et les sons uniques de la langue.

Pendant longtemps, la langue persane a été comme un invité à une immense fête à qui l'on n'avait pas donné de place à table. Tandis que des langues comme l'anglais disposent d'énormes bibliothèques de discours enregistrés (pensez-y comme à de vastes entrepôts bien organisés), le persan en avait très peu. Cela rendait difficile la création de bons assistants vocaux ou de robots conteurs pour les locuteurs persans.

La Solution : ParsVoice
Les auteurs de cet article ont construit ParsVoice, qui est essentiellement une immense bibliothèque de haute qualité de discours persan. C'est la plus grande collection publique de ce genre jamais réalisée pour cette langue.

Voici comment ils ont procédé, décomposé en étapes simples :

1. La Matière Première : Les Livres Audio

Au lieu d'embaucher des acteurs pour lire des scripts en studio (ce qui est coûteux et lent), l'équipe s'est rendue dans une bibliothèque publique de livres audio appelée IranSeda. Imaginez cela comme trouver une montagne de bobines de film brutes et non montées. Ils disposaient de plus de 3 800 livres, mais il y avait un hic : ils ne disposaient pas des scripts écrits (transcriptions) correspondant parfaitement à l'audio.

2. Le Pipeline du « Coupeur Intelligent »

On ne peut pas simplement prendre un fichier de livre audio de 10 heures et le donner à un robot ; il doit être découpé en petites phrases parfaites. L'équipe a construit une « chaîne de montage » automatisée pour faire cela :

  • Le Découpage Grossier : Ils ont utilisé un programme informatique pour repérer les silences entre les phrases et couper l'audio à cet endroit.
  • La Vérification « Avez-vous Fini ? » : Parfois, l'ordinateur coupe l'audio au milieu d'une phrase (comme arrêter un film juste avant que le héros ne dise « Je t'aime »). Ils ont utilisé une IA intelligente (basée sur un modèle appelé ParsBERT) pour lire le texte et demander : « Est-ce une pensée complète ? » Si la réponse était « Non », le système étendait automatiquement la coupe d'une fraction de seconde et vérifiait à nouveau jusqu'à ce que la phrase soit entière.
  • L'Étape « Éliminer le Gras » : Même après le découpage, il pouvait rester un tout petit peu de silence ou un toussotement au début ou à la fin d'un extrait. Le système a utilisé une « recherche binaire » (une façon astucieuse de deviner et de vérifier) pour couper exactement la bonne quantité de silence afin que la voix commence et s'arrête proprement, sans couper de mots.
  • L'Inspecteur de Qualité : Tous les livres audio ne sont pas enregistrés dans un studio insonorisé. Certains peuvent contenir de la musique de fond ou être enregistrés avec de mauvais microphones. Le système a agi comme un éditeur strict, notant chaque extrait sur la clarté audio et l'exactitude du texte. Si un extrait était trop bruyant ou si le texte était du charabia, il était jeté.
  • Le Détective Vocal : Puisqu'un livre audio peut comporter plusieurs narrateurs, le système a utilisé un outil d'« empreinte vocale » pour regrouper tous les extraits par locuteur. Cela leur a permis d'identifier automatiquement 1 815 locuteurs différents.

3. Le Résultat

Le produit final est une bibliothèque de 2 200 heures de phrases persanes propres et parfaitement découpées.

  • Elle est 25 fois plus grande que la plus grande collection de discours persan précédente.
  • Elle contient 1,36 million d'extraits de phrases individuels.
  • Elle couvre 1 815 voix différentes.

4. Est-ce que ça a marché ?

Pour tester si cette bibliothèque était réellement utile, l'équipe a enseigné un modèle de voix IA moderne (appelé XTTS) en utilisant uniquement ces nouvelles données. Ils ne lui ont pas appris d'abord les sons des lettres persanes (phonèmes) ; ils l'ont laissé apprendre directement à partir du texte et de l'audio.

Les résultats ont été impressionnants :

  • Naturalité : Les humains ont évalué la voix du robot comme très naturelle (3,6 sur 5).
  • Adéquation Vocale : Lorsqu'ils ont demandé au robot d'imiter une nouvelle voix qu'il n'avait jamais entendue auparavant, il a fait du bon travail (4,0 sur 5).
  • Intelligibilité : Le robot parlait assez clairement pour que d'autres programmes informatiques puissent le comprendre parfaitement.

Ce Que Cela Ne Fait Pas (Les Limites)

Les auteurs sont honnêtes sur ce que cette bibliothèque n'est pas :

  • Ce n'est pas pour discuter : Parce que les données proviennent de livres audio, les voix ont l'air de lire une histoire (formel et régulier). Si vous demandez au robot d'avoir une conversation décontractée et rapide comme deux amis dans un café, cela pourrait sembler un peu raide.
  • Ce n'est pas parfait : Puisqu'ils ont dû utiliser un ordinateur pour deviner le texte (parce qu'ils ne disposaient pas des livres originaux), il y a quelques petites erreurs dans le texte, bien qu'ils aient filtré la plupart d'entre elles.
  • Équilibre des genres : La bibliothèque contient plus de voix masculines que de voix féminines, simplement parce que les livres audio qu'ils ont utilisés comportaient plus de narrateurs masculins.

En Résumé :
L'équipe a construit une immense usine automatisée qui a transformé des milliers d'heures de livres audio persans bruts en un ensemble de données propre, organisé et massif. Cet ensemble de données est maintenant disponible pour que quiconque puisse l'utiliser afin de construire de meilleures technologies vocales en persan, offrant enfin à la langue une place à la table de la recherche de pointe sur la parole.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →