← Nieuwste papers
💬 NLP

DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

Het artikel introduceert DLLM-TTS, een framework met 0,6 miljard parameters dat tekst-naar-spraak-synthese formuleert als conditionele blok-discrete diffusie over neurale audio-codec-tokens, waarbij competitieve prestaties worden bereikt met een hoge verstaanbaarheid en een real-time factor van 0,15 door middel van parallelle tokenvoorspelling binnen sequentiële blokken.

Oorspronkelijke auteurs: Wasim Madha, Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath

Gepubliceerd 2026-08-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wasim Madha, Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren zingen. Je hebt twee hoofdwegen om dit te doen, en beide hebben een irritante adder onder het gras. De eerste manier is als een student die een boek hardop voorleest, woord voor woord. Ze krijgen de uitspraak perfect onder de knie en het verhaal is logisch, maar ze moeten de hele zin afmaken voordat ze aan de volgende kunnen beginnen. Het is traag, en als je wilt dat de robot als een specifiek persoon klinkt, moet je het een enorme bibliotheek aan boeken voeren (of in dit geval: uren en uren aan opgenomen spraak) om de truc te leren. De tweede manier is als een koor waarbij iedereen tegelijkertijd zijn eigen deel zingt. Het is ongelooflijk snel, maar vaak raken de zangers de draad kwijt, slaan ze woorden over of herhalen ze zichzelf omdat ze niet naar de persoon vóór hen luisteren.

Jarenlang zaten wetenschappers vast in de keuze tussen "perfect maar traag" en "snel maar rommelig." Dit artikel, geschreven door een team van Smallest.ai, stapt in dit rommelige middengebied. Ze werken in het veld van Text-to-Speech (TTS), wat de technologie is die geschreven tekst omzet in gesproken audio. Het kernidee waarmee ze spelen is "discrete diffusie". Denk aan dit als een spelletje "Telefoontje spelen" in omgekeerde richting. In plaats van een bericht door te fluisteren in een rij, stel je voor dat je een zin hebt waarbij alle woorden verborgen zijn achter vraagtekens. De taak van de robot is om de ontbrekende woorden te raden, maar hij raadt ze niet één voor één. Hij raadt een heel blok aan woorden tegelijk, controleert of ze logisch zijn, en verfijnt ze vervolgens. De auteurs wilden zien of ze de snelheid van de "koormethode" konden combineren met de nauwkeurigheid van de "studentmethode", terwijl ze tegelijkertijd veel minder trainingsdata nodig hadden dan gebruikelijk.

Het team introduceert een nieuw framework genaamd DLLM-TTS. In plaats van te proberen het volledige spraaksignaal in één keer te genereren of stukje bij beetje, breken ze de audio af in kleine "blokken", zoals hoofdstukken in een boek. Stel je de spraak voor als een lange trein. De oude snelle methoden probeerden de hele trein in één keer te bouwen, wat er vaak toe leidde dat er wagons van het spoor vlogen. De oude trage methoden bouwden de trein één wagon tegelijk, wachtend tot elke wagon klaar was voordat de volgende werd gestart. DLLM-TTS boust de trein in groepen wagons (blokken). Binnen elke groep raadt de robot alle wagons gelijktijdig, maar hij wacht tot de vorige groep voltooid is voordat hij aan de volgende begint.

Deze "blok"-aanpak zorgt ervoor dat de robot snel is, omdat hij aan veel delen van het geluid tegelijkertijd kan werken, maar het blijft nauwkeurig omdat het nog steeds de volgorde van het verhaal respecteert. De robot gebruikt een speciaal type "maskering" om te leren. Tijdens de training krijgt de robot een zin te zien waarbij sommige woorden verborgen zijn, en hij moet ontdekken wat deze zijn op basis van de tekst en een korte sample van de stem die hij wil nabootsen. Omdat de robot dezelfde zin ziet met telkens andere verborgen woorden, leert hij de regels van spraak veel sneller dan wanneer hij de zin simpelweg van begin tot eind zou lezen. Dit is als het leren van een liedje door verschillende coupletten in willekeurige volgorde te oefenen, in plaats van alleen maar het hele liedje keer op keer te zingen; je leert de melodie en de tekst efficiënter.

De resultaten zijn zeer veelbelovend. Het team trainde een model met 0,6 miljard parameters (een maatstaf voor hoe "groot" het brein van de robot is) met slechts 20.000 uur aan spraakdata. Om dit in perspectief te plaatsen: andere top-robots hebben vaak tussen de 60.000 en 250.000 uur aan data nodig om dezelfde trucs te leren. Ondanks het gebruik van minder data, presteert hun robot competitief op standaardtests voor hoe goed ze spreken en hoeveel ze lijken op de persoon die ze nabootsen. Wat betreft snelheid kan de robot spraak genereren in realtime met een "Real-Time Factor" (RTF) van 0,15. Dit betekent dat het de robot slechts 0,15 seconden kost om één seconde aan audio te genereren, wat het snel genoeg maakt voor live gesprekken.

Het artikel suggereert dat deze blokgebaseerde aanpak een sterk alternatief is voor de traditionele methoden. Het laat zien dat je niet noodzakelijkerwijs een enorme hoeveelheid data of een supertraag, sequentieel proces nodig hebt voor hoogwaardige spraak. Door het probleem op te delen in beheersbare stukken en een "raden-en-verfijnen"-strategie te gebruiken, hebben de auteurs een systeem gecreëerd dat zowel datamentefficiënt als snel is. Hoewel het artikel niet beweert dat dit de absolute definitieve oplossing is voor álle spraakproblemen, demonstreert het dat deze specifieke manier van het combineren van snelheid en nauwkeurigheid zeer goed werkt en een nieuwe weg biedt voor het maken van robots die natuurlijk en snel kunnen praten zonder dat ze een bibliotheek van elke stem ter wereld nodig hebben om te leren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →