← Nieuwste papers
🤖 AI

End-to-End Training for Discrete Token LLM based TTS System

Dit artikel stelt een volledig end-to-end trainingsframework voor dat een spraaktokenizer, een autoregressief LLM, een flow-matching model en een beloningsmodel gezamenlijk optimaliseert om discrete token-gebaseerde TTS-componenten te verenigen, waarmee een nieuwe state-of-the-art prestatie wordt bereikt met een aanzienlijk eenvoudigere pijplijn vergeleken met traditionele gecascadeerde benaderingen.

Oorspronkelijke auteurs: Changfeng Gao, Yong Ren, Jun Yuan, Ye Bai, Zhao You, ShiDong Shang

Gepubliceerd 2026-06-09
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Changfeng Gao, Yong Ren, Jun Yuan, Ye Bai, Zhao You, ShiDong Shang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Van een Estafette naar een Symfonie

Stel je voor dat het bouwen van een Text-to-Speech (TTS) systeem (een computer die tekst hardop voorleest) lijkt op het bouwen van een estafetteteam.

De Oude Manier (Cascaded Pipeline):
In de meeste huidige systemen heb je drie aparte hardlopers:

  1. De Vertaler (Tokenizer): Neemt het geluid van een stem en zet het om in een geheime code van getallen (tokens).
  2. De Voorspeller (LLM): Leest de tekst en raadt het volgende getal in die geheime code.
  3. De Zanger (FM Model): Neemt die geraden getallen en zet ze terug om in geluidsgolven.

Het probleem? Deze drie hardlopers trainen afzonderlijk. De Vertaler traint om goed te zijn in ASR (spraakherkenning), de Voorspeller traint om getallen te raden, en de Zanger traint om geluid te reconstrueren. Ze praten tijdens de training nooit met elkaar. Wanneer ze eindelijk samen aan de race beginnen, struikelen ze omdat ze elkaars stijl niet kennen. Het is als een vertaler die een dialect spreekt dat de voorspeller niet begrijpt, wat leidt tot een slordige uiteindelijke uitvoering.

De Nieuwe Manier (End-to-End Training):
Dit artikel stelt voor om alle drie de hardlopers (plus een Coach) samen te trainen in één grote, verenigde oefensessie. Ze leren dezelfde taal te spreken, elkaars bewegingen te anticiperen en hun prestaties in realtime aan te passen.


De Personages

  1. De Spraak-Tokenizer (De Vertaler):

    • Wat het doet: Het hakt een menselijke stem in kleine, discrete "Lego-steentjes" (tokens).
    • Het Oude Probleem: Het werd getraind om een goede vertaler te zijn voor mensen (zoals in spraak-naar-tekst apps), niet noodzakelijkerwijs voor de volgende stappen van de computer.
    • De Oplossing: In dit nieuwe systeem leert de Vertaler om Lego-steentjes te maken die specifiek ontworpen zijn voor de Voorspeller en de Zanger om te gebruiken.
  2. De LLM (De Voorspeller):

    • Wat het doet: Het leest de tekst die je typt en voorspelt de reeks Lego-steentjes die nodig zijn om het uit te spreken.
    • Het Oude Probleem: Het werd getraind om het "meest waarschijnlijke" steentje te raden, wat de stem vaak vlak, saai of "gemiddeld" maakte.
    • De Oplossing: Het krijgt directe feedback van de Zanger en de Coach over of de gokken daadwerkelijk goed klinken, en niet alleen of ze statistisch gezien waarschijnlijk zijn.
  3. Het Flow-Matching Model (De Zanger):

    • Wat het doet: Het neemt de Lego-steentjes en bouwt de eigenlijke stemgolf.
    • Het Oude Probleem: Het werd getraind op perfecte steentjes (van de grondwaarheid), maar in de echte wereld maakt de Voorspeller fouten. Daarom zou de Zanger crashen wanneer hij imperfecte steentjes krijgt.
    • De Oplossing: Het leert te zingen, zelfs als de steentjes een beetje imperfect zijn, waardoor het systeem robuuster wordt.
  4. Het Reward Model (De Coach):

    • Wat het doet: Dit is een nieuwe toevoeging. Het luistert naar de output en controleert drie dingen: "Hadden ze de juiste woorden gezegd?" (ASR), "Klinkt het als de juiste persoon?" (Speaker ID) en "Zijn ze emotioneel?" (Emotion).
    • De Rol: Het fungeert als een scheidsrechter die punten geeft voor goede uitspraak en stijl, en het hele team richting een betere uitvoering stuurt.

Hoe Ze Trainen: De Drie-Fasen Repetitie

De auteurs gooiden niet iedereen in één keer in de ring; ze gebruikten een slimme driefasen-trainingspipeline om de boel stabiel te houden.

Fase 1: De Fundering (First-Order Loss)

  • De Analogie: Stel je voor dat de Vertaler, de Voorspeller en de Zanger allemaal naar het perfecte script en de perfecte opname kijken.
  • Wat er gebeurt: Ze leren allemaal samen. De Vertaler leert om steentjes te maken die makkelijk te raden zijn voor de Voorspeller en makkelijk te gebruiken voor de Zanger. De Coach kijkt mee en zorgt ervoor dat de steentjes de juiste betekenis en emotie overbrengen.
  • Doel: Om iedereen op één lijn te krijgen en te voorkomen dat de Vertaler "slechte" steentjes maakt die anderen in verwarring brengen.

Fase 2: De Onafhankelijke Oefening

  • De Analogie: De Vertaler is nu een meester en verandert niet meer. De Voorspeller en de Zanger oefenen op hun eigen, maar ze mogen verschillende datasets gebruiken (misschien oefent de Zanger op ruizige opnames terwijl de Voorspeller op schone opnames oefent).
  • Doel: Om de specifieke vaardigheden van de Zanger en de Voorspeller te verfijnen zonder de code van de Vertaler te verstoren.

Fase 3: De Generale Repetitie (Second-Order Loss)

  • De Analogie: Dit is het grote spel. De Voorspeller mag nu fouten maken (het raden van de steentjes in plaats van het gebruiken van de perfecte steentjes). De Zanger en de Coach moeten omgaan met deze imperfecte gokken.
  • De Magie: Als de Voorspeller een fout steentje raadt, stuurt de Zanger en de Coach een signaal terug naar de Voorspeller: "Die gok maakte de stem slecht, probeer het opnieuw."
  • Doel: Dit sluit de cirkel. De Voorspeller leert gokken die de Zanger daadwerkelijk kan verwerken, en de Zanger leert robuust te zijn tegen fouten. Dit elimineert de "train-test mismatch" (waarbij het systeem in de praktijk werkt maar faalt in de echte wereld).

De Resultaten: Waarom het Er Toe Doet

Het artikel beweert dat door iedereen samen te trainen, het systeem aanzienlijk beter wordt.

  • Betere Nauwkeurigheid: In een standaardtest (Seed-TTS) maakte hun systeem zeer weinig fouten in de uitspraak (Word Error Rate van 0,78% voor Chinees en 1,56% voor Engels). Dit is een nieuw "State-of-the-Art" (SOTA) record.
  • Kleinere Modellen: Ze bereikten dit met relatief kleine modellen (0,6B parameters voor de Voorspeller en 0,5B voor de Zanger), wat bewijst dat je geen massief, opgeblazen systeem nodig hebt om geweldige resultaten te behalen als je het efficiënt traint.
  • Rijkere Informatie: De "Lego-steentjes" (tokens) die door dit systeem worden gemaakt, zijn slimmer. Ze bevatten meer nuttige informatie over zowel het geluid als de betekenis, en ze gebruiken de beschikbare "codebook" (de verzameling van alle mogeleijke steentjes) veel efficiënter, waardoor het probleem wordt vermeden waarbij het systeem slechts enkele veelvoorkomende steentjes gebruikt en de rest negeert.

De Kern van het Verhaal

Dit artikel betoogt dat de oude manier van TTS-systemen bouwen—waarbij je de onderdelen apart bouwt en hoopt dat ze passen—inefficiënt is. Door het hele systeem als één groot, onderling verbonden organisme te behandelen en het end-to-end te trainen, krijg je een stem die nauwkeuriger, expressiever en gemakkelijker te trainen is, zelfs met kleinere computermodellen. Het is het verschil tussen een groep vreemden die probeert samen een lied te spelen versus een band die elke noot maandenlang samen heeft geoefend.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →