← Nieuwste papers
💬 NLP

LLM-to-Speech: A Synthetic Data Pipeline for Training Dialectal Text-to-Speech Models

Deze paper introduceert NileTTS, het eerste publiek beschikbare Egyptisch-Arabische tekst-naar-spraak-dataset, dat via een synthetische pijplijn met grote taalmodellen is gegenereerd om een open-source XTTS v2-model te trainen en zo de onderbelichting van deze dialectvariëteit aan te pakken.

Oorspronkelijke auteurs: Ahmed Khaled Khamis, Hesham Ali

Gepubliceerd 2026-03-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ahmed Khaled Khamis, Hesham Ali

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat de wereld van spraaktechnologie (waar computers je tekst voorlezen) een enorme bibliotheek is. In deze bibliotheek staan er duizenden boeken over hoe je Standaard-Arabisch (de officiële, formele taal) moet lezen, en er zijn ook veel boeken over de Golf-dialecten (gesproken in landen als Saoedi-Arabië).

Maar er is een enorm gat in de schappen: er zijn bijna geen boeken over Egyptisch Arabisch. En dat is raar, want Egyptisch Arabisch wordt door meer dan 100 miljoen mensen gesproken en is door de invloed van Egyptische films en muziek eigenlijk het meest begrepen dialect in de hele Arabische wereld. Het is alsof je een bibliotheek hebt vol met recepten voor Franse cuisine, maar geen enkele voor pizza, terwijl iedereen van pizza houdt.

De auteurs van dit paper, Ahmed en Hesham, wilden dit gat dichten. Ze hebben een nieuw project gestart genaamd NileTTS. Hier is hoe ze het gedaan hebben, vertaald in alledaagse termen:

1. Het Probleem: Te duur om te filmen

Normaal gesproken maak je een dataset voor spraak door mensen in een studio te laten zitten en urenlang te laten praten. Dat is echter heel duur en tijdrovend, vooral voor dialecten waar minder vraag naar is. Het was alsof ze een nieuwe film wilden maken, maar geen budget hadden om acteurs te huren.

2. De Oplossing: Een "AI-Fabriek"

In plaats van mensen te laten praten, bouwden ze een slimme fabriek die alles automatisch doet. Ze gebruikten drie soorten AI als werknemers in hun fabriek:

  • De Schrijver (LLM): Eerst gebruikten ze een slimme tekst-AI (zoals een super-intelligente schrijver) om verhalen te bedenken in het echte Egyptisch. Denk aan gesprekken over doktersbezoeken, het verkopen van producten of gewoon kletsen over het weer. De AI zorgde ervoor dat het klinkt als een echte Egyptenaar, niet als een robot die Standaard-Arabisch leest.
  • De Stemacteur (Neural Audio Synthesis): Vervolgens gaven ze die teksten aan een andere AI (NootebookLM). Deze AI fungeerde als een stemacteur. Het las de teksten voor in een podcast-stijl, met twee verschillende stemmen: een man en een vrouw. Het klinkt zo natuurlijk dat je bijna zou denken dat het echte mensen zijn.
  • De Secretaris (Transcriptie & Diarization): Omdat de computer de tekst zelf had gegenereerd, wisten ze wat er gezegd werd. Maar ze moesten de audio wel "opschrijven" en controleren wie wat zei. Ze gebruikten een derde AI (Whisper) om de audio terug te schrijven naar tekst, en nog een slimme tool om te zeggen: "Ah, dit stukje werd gezegd door de man, en dat stukje door de vrouw."

3. Het Resultaat: De "NileTTS" Bibliotheek

Uiteindelijk hadden ze 38 uur aan audio-opnames. Dat is ongeveer 9.500 losse zinnen, verdeeld over drie gebieden:

  • Gezondheid en medische adviezen.
  • Verkoop en klantenservice.
  • Alledaagse gesprekken.

Dit is hun nieuwe "trainingsboek" voor spraakcomputers.

4. De Test: Leren van de nieuwe methode

Ze namen een bestaande, zeer slimme spraakcomputer (genaamd XTTS v2) die al veel talen kon, maar slecht was in het Egyptisch. Ze gaven hen dit nieuwe "trainingsboek" (NileTTS) om te studeren.

Het resultaat was verbazingwekkend:

  • Begrijpelijkheid: De computer maakte veel minder fouten. Waar hij voorheen 27% van de woorden verkeerd uitsprak, deed hij dat nu maar in 19% van de gevallen.
  • Klinken als een mens: De stem klonk veel natuurlijker en leek meer op de echte Egyptische stemmen.

Waarom is dit belangrijk?

Stel je voor dat je een stemassistent hebt (zoals Siri of Alexa) die je in het Standaard-Arabisch begrijpt, maar als je in je eigen Egyptische dialect vraagt: "Hoe is het weer in Caïro?", dan kijkt hij je raar aan en zegt: "Ik begrijp je niet."

Met NileTTS kunnen ontwikkelaars nu stemassistenten bouwen die echt begrijpen wat Egyptenaren zeggen. En het mooiste is: ze hebben bewezen dat je niet per se duizenden mensen hoeft te laten praten om dit te doen. Je kunt een slimme, reproduceerbare "AI-fabriek" bouwen die dit voor je doet.

Kortom: Ze hebben een nieuwe, goedkope manier gevonden om de "spraakbibliotheek" voor Egyptisch Arabisch te vullen, zodat de technologie eindelijk evenveel aandacht krijgt als de mensen die het spreken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →