ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis
Het artikel introduceert ParsVoice, een publiek beschikbare meerstemmige Perzische spraakcorpus van 2.200 uur, opgebouwd via een schaalbaar proces uit audioboeken, wat de open Perzische TTS-bronnen aanzienlijk uitbreidt en hoge synthesekwaliteit aantoont bij het fine-tunen van het XTTS-model.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot wilt leren Perzisch spreken. Je kunt het niet zomaar een woordenboek geven; je moet het duizenden uren aan echte menselijke stemmen voeden die verhalen lezen, zodat het de ritmiek, de emotie en de unieke klanken van de taal kan leren.
Lange tijd was de Perzische taal als een gast op een enorm feest die geen plek aan tafel kreeg. Terwijl talen zoals het Engels enorme bibliotheken met opgenomen spraak hebben (denk aan enorme, goed georganiseerde magazijnen), had het Perzisch zeer weinig. Dit maakte het moeilijk om goede spraakassistenten of verhalenvertellende robots voor Perzischsprekenden te bouwen.
De Oplossing: ParsVoice
De auteurs van dit artikel bouwden ParsVoice, wat in wezen een enorme, hoogwaardige bibliotheek met Perzische spraak is. Het is de grootste publieke verzameling van zijn soort die ooit voor deze taal is gemaakt.
Hier is hoe ze dit deden, opgesplitst in eenvoudige stappen:
1. Het Grondmateriaal: Luisterboeken
In plaats van acteurs in te huren om scripts in een studio te lezen (wat duur en traag is), ging het team naar een openbare bibliotheek met luisterboeken genaamd IranSeda. Denk hierbij aan het vinden van een berg ruwe, onbewerkte filmrollen. Ze hadden meer dan 3.800 boeken, maar er was een addertje onder het gras: ze hadden niet de geschreven scripts (transcripties) die perfect overeenkwamen met de audio.
2. De "Slimme Snijder"-Pijplijn
Je kunt niet zomaar een 10-uurs luisterboekbestand aan een robot geven; het moet worden opgehakt in tiny, perfecte zinnen. Het team bouwde een geautomatiseerde "productielijn" om dit te doen:
- De Ruwe Snede: Ze gebruikten een computerprogramma om de stilte tussen zinnen te vinden en de audio daar te snijden.
- De "Ben Je Klaar?"-Controle: Soms snijdt de computer de audio halverwege een zin (alsof je een film stopt net voordat de held zegt "Ik hou van jou"). Ze gebruikten een slimme AI (gebaseerd op een model genaamd ParsBERT) om de tekst te lezen en te vragen: "Is dit een complete gedachte?" Als het antwoord "Nee" was, verlengde het systeem de snede automatisch met een fractie van een seconde en controleerde het opnieuw tot de zin heel was.
- De "Vet Trimmen"-Stap: Zelfs na het snijden kan er nog een klein beetje stilte of een hoestje aan het begin of einde van een clip zitten. Het systeem gebruikte een "binair zoeken" (een slimme manier van gokken en controleren) om precies de juiste hoeveelheid stilte weg te knippen, zodat de stem schoon begint en stopt, zonder woorden af te hakken.
- De Kwaliteitscontroleur: Niet alle luisterboeken zijn opgenomen in een geluidsdichte studio. Sommige hebben achtergrondmuziek of slechte microfoons. Het systeem fungeerde als een strenge redacteur en gaf elke clip een score op audiohelderheid en tekstnauwkeurigheid. Als een clip te luidruchtig was of de tekst onzin, werd deze weggegooid.
- De Stem-Detective: Omdat één luisterboek meerdere vertellers kan hebben, gebruikte het systeem een "stemvingerafdruk"-tool om alle clips te groeperen op basis van wie er sprak. Dit stelde hen in staat om automatisch 1.815 verschillende sprekers te identificeren.
3. Het Resultaat
Het eindproduct is een 2.200-uren bibliotheek met schone, perfect opgehakte Perzische zinnen.
- Het is 25 keer groter dan de vorige grootste Perzische spraakcollectie.
- Het bevat 1,36 miljoen individuele zinnenclips.
- Het dekt 1.815 verschillende stemmen.
4. Werkte Het?
Om te testen of deze bibliotheek daadwerkelijk nuttig was, leerde het team een moderne AI-stemmmodel (genaamd XTTS) uitsluitend met deze nieuwe data. Ze leerden het eerst niet de klanken van Perzische letters (fonemen); ze lieten het direct leren uit de tekst en audio.
De resultaten waren indrukwekkend:
- Natuurlijkheid: Mensen beoordeelden de stem van de robot als zeer natuurlijk (3,6 van de 5).
- Stemmatching: Toen ze de robot vroegen een nieuwe stem na te bootsen die het nog nooit had gehoord, deed het een uitstekende baan (4,0 van de 5).
- Begrijpelijkheid: De robot sprak duidelijk genoeg zodat andere computerprogramma's het perfect konden begrijpen.
Wat Het Niet Doet (De Beperkingen)
De auteurs zijn eerlijk over wat deze bibliotheek niet is:
- Het is niet voor chatten: Omdat de data uit luisterboeken komt, klinken de stemmen alsof ze een verhaal lezen (formeel en gestaag). Als je de robot vraagt een casual, snel tempo gesprek te voeren zoals twee vrienden in een koffiebar, kan het een beetje stijf klinken.
- Het is niet perfect: Omdat ze een computer moesten gebruiken om de tekst te raden (omdat ze de originele boeken niet hadden), zitten er een paar kleine fouten in de tekst, hoewel ze de meeste ervan hebben gefilterd.
- Geslachtsbalans: De bibliotheek heeft meer mannelijke stemmen dan vrouwelijke stemmen, simpelweg omdat de luisterboeken die ze gebruikten meer mannelijke vertellers hadden.
Samenvattend:
Het team bouwde een gigantische, geautomatiseerde fabriek die duizenden uren aan ruwe Perzische luisterboeken omzette in een schone, georganiseerde en enorme dataset. Deze dataset is nu beschikbaar voor iedereen om betere Perzische stemtechnologieën te bouwen, waardoor de taal eindelijk een plek aan tafel krijgt in het onderzoek naar spraak op hoogtechnologisch niveau.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.