← Ultimi articoli
🤖 machine learning

ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis

Il documento presenta ParsVoice, un corpus di parlato persiano multi-parlante di 2.200 ore pubblicamente disponibile, costruito tramite una pipeline scalabile a partire da audiolibri, che espande significativamente le risorse open per la sintesi vocale in persiano e dimostra prestazioni di sintesi di alta qualità quando utilizzato per il fine-tuning del modello XTTS.

Autori originali: Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

Pubblicato 2026-05-27
📖 5 min di lettura🧠 Approfondimento

Autori originali: Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di voler insegnare a un robot a parlare persiano. Non puoi limitarti a fornirgli un dizionario; devi nutrirlo con migliaia di ore di voci umane reali che leggono storie, in modo che possa apprendere il ritmo, l'emozione e i suoni unici della lingua.

Per lungo tempo, la lingua persiana è stata come un ospite a una festa enorme a cui non è stato assegnato un posto a tavola. Mentre lingue come l'inglese dispongono di enormi biblioteche di registrazioni vocali (immaginale come magazzini massicci e ben organizzati), il persiano ne aveva ben poche. Questo rendeva difficile costruire assistenti vocali o robot narratori efficaci per i parlanti persiani.

La Soluzione: ParsVoice
Gli autori di questo articolo hanno creato ParsVoice, che è essenzialmente una biblioteca massiccia e di alta qualità di registrazioni vocali in persiano. È la più grande raccolta pubblica del genere mai realizzata per questa lingua.

Ecco come l'hanno fatto, scomposto in passaggi semplici:

1. La Materia Prima: Audiolibri

Invece di assumere attori per leggere sceneggiature in uno studio (cosa costosa e lenta), il team si è rivolto a una biblioteca pubblica di audiolibri chiamata IranSeda. Immagina di trovare una montagna di bobine di film grezze e non tagliate. Avevano oltre 3.800 libri, ma c'era un problema: non disponevano delle trascrizioni scritte che corrispondevano perfettamente all'audio.

2. La Pipeline "Tagliatore Intelligente"

Non puoi semplicemente prendere un file di audiolibro di 10 ore e darlo in pasto a un robot; deve essere spezzettato in frasi minuscole e perfette. Il team ha costruito una "linea di produzione" automatizzata per farlo:

  • Il Taglio Grezzo: Hanno utilizzato un programma informatico per individuare i silenzi tra le frasi e tagliare l'audio in quei punti.
  • Il Controllo "Hai Finito?": A volte, il computer taglia l'audio a metà di una frase (come fermare un film proprio prima che l'eroe dica "Ti amo"). Hanno utilizzato un'intelligenza artificiale intelligente (basata su un modello chiamato ParsBERT) per leggere il testo e chiedere: "È un pensiero completo?". Se la risposta era "No", il sistema estendeva automaticamente il taglio di una frazione di secondo e ricontrollava finché la frase non era intera.
  • Il Passo "Rimuovi il Grasso": Anche dopo il taglio, potrebbe esserci un minuscolo silenzio o un colpo di tosse all'inizio o alla fine di un clip. Il sistema ha utilizzato una "ricerca binaria" (un modo astuto di indovinare e verificare) per tagliare esattamente la quantità giusta di silenzio in modo che la voce inizi e termini in modo pulito, senza tranciare via parole.
  • L'Ispettore di Qualità: Non tutti gli audiolibri sono registrati in uno studio insonorizzato. Alcuni potrebbero avere musica di sottofondo o microfoni scadenti. Il sistema ha agito come un editor severo, assegnando un punteggio a ogni clip per chiarezza audio e accuratezza del testo. Se un clip era troppo rumoroso o il testo era incomprensibile, veniva scartato.
  • Il Detective delle Voci: Poiché un audiolibro potrebbe avere più narratori, il sistema ha utilizzato uno strumento "impronta vocale" per raggruppare tutti i clip in base a chi parlava. Questo ha permesso di identificare automaticamente 1.815 parlanti diversi.

3. Il Risultato

Il prodotto finale è una libreria di 2.200 ore di frasi persiane pulite e perfettamente tagliate.

  • È 25 volte più grande della precedente più grande raccolta di voci persiane.
  • Contiene 1,36 milioni di clip di frasi individuali.
  • Copre 1.815 voci diverse.

4. Ha Funzionato?

Per testare se questa biblioteca fosse effettivamente utile, il team ha addestrato un moderno modello di voce AI (chiamato XTTS) utilizzando solo questi nuovi dati. Non hanno insegnato prima i suoni delle lettere persiane (fonemi); hanno lasciato che apprendesse direttamente dal testo e dall'audio.

I risultati sono stati impressionanti:

  • Naturalità: Gli esseri umani hanno valutato la voce del robot come molto naturale (3,6 su 5).
  • Corrispondenza Vocale: Quando hanno chiesto al robot di imitare una nuova voce che non aveva mai sentito prima, ha fatto un ottimo lavoro (4,0 su 5).
  • Intelligibilità: Il robot parlava in modo abbastanza chiaro da permettere ad altri programmi informatici di comprenderlo perfettamente.

Cosa Non Fa (I Limiti)

Gli autori sono onesti su ciò che questa biblioteca non è:

  • Non è per chiacchierare: Poiché i dati provengono da audiolibri, le voci suonano come se stessero leggendo una storia (formali e costanti). Se chiedi al robot di avere una chiacchierata informale e veloce come due amici in una caffetteria, potrebbe suonare un po' rigido.
  • Non è perfetta: Poiché hanno dovuto usare un computer per indovinare il testo (poiché non disponevano dei libri originali), ci sono alcuni piccoli errori nel testo, sebbene ne abbiano filtrato la maggior parte.
  • Bilanciamento di Genere: La biblioteca ha più voci maschili che femminili, semplicemente perché gli audiolibri che hanno utilizzato avevano più narratori maschi.

In Sintesi:
Il team ha costruito una gigantesca fabbrica automatizzata che ha trasformato migliaia di ore di audiolibri persiani grezzi in un dataset pulito, organizzato e massiccio. Questo dataset è ora disponibile per chiunque voglia costruire migliori tecnologie vocali in persiano, dando finalmente alla lingua un posto a tavola nella ricerca vocale high-tech.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →