← Nieuwste papers
⚡ electrical engineering

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

Het artikel introduceert WordVoice, een verenigd framework dat de beperkingen van grofmazige controle bij LLM-gebaseerde TTS aanpakt door gebruik te maken van een massale, vijfdimensionaal geannoteerde dataset en een nieuw bound-token-mechanisme om expliciete, ontkoppelde en precieze woordniveau-manipulatie van akoestische attributen zoals duur, toonhoogte en energie mogelijk te maken.

Oorspronkelijke auteurs: Sihang Nie, Jinxin Ji, Xiaofen Xing, Deyi Tuo, Chengbin Jin, Jialong Mai, Xiangmin Xu

Gepubliceerd 2026-07-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sihang Nie, Jinxin Ji, Xiaofen Xing, Deyi Tuo, Chengbin Jin, Jialong Mai, Xiangmin Xu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een film regisseert, maar de acteurs (de AI-stem) improviseren. Ze klinken geweldig en natuurlijk, maar je kunt ze niet precies vertellen hoe ze een specifiek woord moeten uitspreken. Je kunt niet zeggen: "Pauzeer hier een fractie van een seconde," of "Laat dit woord boos klinken," of "Zing deze noot hoger." Je moet hopen dat de AI je intentie correct raadt.

Dit paper introduceert WordVoice, een nieuw systeem dat regisseurs (gebruikers) een afstandsbediening geeft voor elk afzonderlijk woord in een zin. Het verandert de AI van een improviserende acteur in een scriptgetrouwe performer die jouw exacte instructies opvolgt.

Dit is hoe ze het hebben gedaan, uitgelegd via eenvoudige analogieën:

1. Het Probleem: De "Vage" Afstandsbediening

Huidige AI-stem-systemen zijn als een afstandsbediening met slechts een paar grote knoppen: "Blij," "Verdrietig," of "Snel." Als je de toonhoogte van slechts één woord in een lange zin wilt veranderen, werkt de afstandsbediening niet. De AI behandelt de hele zin als één grote klankmassa, waardoor het onmogelijk is om individuele delen nauwkeurig aan te passen.

2. De Oplossing: Een Massief "Instructieboek" (WordVoice-5A)

Om de AI te leren hoe hij naar deze kleine, specifieke instructies moet luisteren, moesten de onderzoekers eerst een enorme bibliotheek van voorbeelden bouwen.

  • De Analogie: Stel je voor dat je probeert een student piano te leren door alleen hele liedjes te laten zien. Ze zullen misschien de algemene sfeer leren, maar ze zullen niet weten hoe ze een specifieke noot met een specifieke kracht moeten raken.
  • Wat ze deden: Het team creëerde WordVoice-5A, een dataset van 4.700 uur spraak (een enorme bibliotheek!). Ze labelden niet alleen de hele zin; ze gingen woord voor woord te werk en schreven vijf specifieke "instructies" voor elk afzonderlijk woord:
    1. Duur: Hoe lang het woord duurt.
    2. Grens (Boundary): Is er een pauze voor of na het woord?
    3. Energie: Hoe luid of benadrukt het is.
    4. Toonhoogte (Pitch): Hoe hoog of laag de stem is.
    5. Toon (Tone): De vorm van de melodie (stijgend, dalend, vlak, etc.).

Ze gebruikten een strikt, door taalkundigen geleid proces om ervoor te zorgen dat deze labels perfect waren, waardoor ze de ultieme "instructiehandleiding" voor de AI creëerden.

3. De Hersenen: De "Akoestische Planner" (WordVoice-LLM)

De kern van hun systeem is een Large Language Model (LLM), wat de "hersenen" is die de spraak genereren.

  • De Oude Manier: De hersenen zouden gewoon het volgende geluid raden, in de hoop dat het goed klonk.
  • De Nieuwe Manier (WordVoice): De onderzoekers voegden een speciale "planning token" toe (denk aan een briefje met een post-it). Voordat de AI een woord uitspreekt, stopt hij en schrijft hij een plan op dat briefje.
    • Voorbeeld: "Voor het woord 'Hallo', plan ik: 0,5 seconden lang, hoge energie, stijgende toonhoogte."
    • Zodra het plan is geschreven, spreekt de AI het woord exact volgens dat plan uit.
  • De Magie: Gebruikers kunnen de AI ofwel zijn eigen plan laten schrijven (Free Mode), of het plan zelf schrijven (Control Mode). Als je wilt dat een specifiek woord dramatisch klinkt, schrijf je simpelweg "Hoge Energie" op het briefje, en de AI gehoorzaamt.

4. De Stemkast: De "Fine-Tuner" (WordVoice-FM)

Zelfs met een perfect plan kan de "stemkast" van de AI (het deel dat digitale noten omzet in daadwerkelijke geluidsgolven) soms details verliezen, zoals een foto met een lage resolutie.

  • De Analogie: Stel je voor dat je een perfect architecturaal blauwdruk (het plan) hebt, maar de bouwer gebruikt ruwe bakstenen. De vorm is juist, maar de textuur klopt niet.
  • Wat ze deden: Ze voegden een "Fine-Tuner" module toe aan het einde. Deze module kijkt naar de blauwdruk en de ruwe bakstenen, en strijkt ze vervolgens glad om ervoor te zorgen dat de uiteindelijke geluidsgolf perfect bij het plan past. Het overbrugt de kloof tussen de digitale "noten" en de continue "klank", waardoor de energie en toonhoogte exact zijn zoals je hebt gevraagd.

5. De Resultaten: Totale Controle

Het team heeft dit systeem getest tegen andere top AI-stemtools.

  • De Verdict: WordVoice stelt gebruikers in staat om de duur, luidheid, toonhoogte en toon van specifieke woorden met extreme precisie te veranderen.
  • De Trade-off: Het paper merkt een kleine trade-off op. Omdat de AI zo hard gefocust is op het volgen van jouw specifieke instructies voor individuele woorden, is de algemene "natuurlijke flow" van de stem iets minder perfect dan wanneer de AI gewoon zou improviseren. Echter, de winst in controle is enorm.
  • Het Bewijs: Wanneer ze de AI vroegen om slechts één woord van toon of lengte te veranderen, deed de AI dit met hoge nauwkeurigheid, terwijl andere systemen er niet in slaagden om die specifieke wijzigingen door te voeren zonder de hele zin te verstoren.

Samenvatting

WordVoice is als het geven van een script aan een stemacteur waarbij bij elk afzonderlijk woord een specifieke regie staat aangegeven (bijv. "Zeg dit woord luid," "Zeg dit woord langzaam"). Het lost het probleem van "grove controle" op door spraak op te splitsen in kleine, beheersbare stukjes en de gebruiker een afstandsbediening voor elk stukje te geven, terwijl de stem toch natuurlijk en menselijk blijft klinken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →