VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation
VoiceDesigner is een verenigd framework dat een hybride datapijplijn en een verbeterde diffusietransformer inzet om de bestaande beperkingen bij het genereren van diverse realistische en fictieve stemmen te overwinnen, terwijl het robuuste, controleerbare stembewerking mogelijk maakt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin je stem niet slechts een biologisch toeval is, maar een aanpasbaar instrument dat je kunt stemmen als een gitaar. Decennialang waren computers erg goed in het hardop voorlezen van tekst, maar ze klonken meestal als één enkele, stijve robot, tenzij je ze een opname van een echt persoon voedt om te kopiëren. Dit vakgebied, bekend als Text-to-Voice (TTV), probeert dat te veranderen. In plaats van alleen een specifiek persoon te kopiëren, leren wetenschappers computers om beschrijvingen zoals "een chagrijnige oude tovenaar" of "een enthousiast buitenaards wezen" te begrijpen en een stem vanuit het niets te creëren. Het is alsof je een chef-kok een recept geeft dat in woorden is geschreven in plaats van een afbeelding van het gerecht; het doel is om de exacte smaak, textuur en geur op te roepen door alleen de instructies te lezen. Maar tot nu toe hadden deze digitale chefs moeite met twee grote problemen: ze konden vooral alleen "menselijke" gerechten bereiden, en als je hen vroeg om een smaak aan te passen (zoals een stem vrolijker laten klinken), verpestten ze vaak de hele maaltijd.
Maak kennis met VoiceDesigner, een nieuw systeem dat fungeert als een meesterlijke stemarchitect. De onderzoekers achter dit project realiseerden zich dat bestaande systemen in een sleur zaten, waarbij ze voornamelijk standaard menselijke stemmen genereerden en faalden wanneer ze werden gevraagd om fictieve personages zoals draken of demonen te creëren, of wanneer ze probeerden de stemming van een stem aan te passen zonder deze te breken. Om dit op te lossen, bouwden ze een verenigd framework dat stemcreatie en stembewerking behandelt als twee zijden van dezelfde munt. Denk aan een enkele, superintelligente studio waar je ofwel een stem vanaf de grond opbouwt met behulp van een tekstuele beschrijving, of een bestaande stem kunt hervormen met een eenvoudige instructie zoals "maak het mysterieuzer laten klinken".
Het geheime ingrediënt achter VoiceDesigner is een slimme mix van twee zaken. Ten eerste vertrouwden ze niet alleen op opnames van echte mensen; ze bouwden een "stemfabriek" die digitale signaalverwerking (zoals het draaien aan knoppen op een mengpaneel) en generatieve AI gebruikt om duizenden nep maar realistische stemmen te creëren. Dit stelde hen in staat om hun systeem te trainen op alles van menselijk gefluister tot het diepe gerommel van een monster, waardoor de gaten die echte opnames achterlieten, werden opgevuld. Ten tweede hebben ze het brein van het systeem geüpgraded — een type AI dat een Diffusion Transformer wordt genoemd. Ze gaven het een nieuwe manier om naar instructies, transcripties en audio-referenties te luisteren zonder in de war te raken, met behulp van een speciaal 3D-positioneringssysteem dat de verschillende soorten informatie georganiseerd houdt, zoals een bibliothecaris die nooit boeken, films en muziek door elkaar haalt.
De resultaten suggerieën dat deze aanpak opmerkelijk goed werkt. In tests was VoiceDesigner beter in het opvolgen van complexe instructies dan andere open-source modellen, en slaagde het erin om stemmen voor personages zoals piraten en robots te genereren die precies klonken zoals beschreven. Het bewees ook een meesterlijke editor te zijn, in staat om de emotie of toon van een spreker te veranderen zonder de oorspronkelijke identiteit te verliezen. Hoewel er nog een kleine kloof te overbruggen is met de beste commerciële systemen, laat het artikel zien dat we door creatieve datasimulatie te combineren met een slimmer, verenigd model, veel dichter bij een toekomst komen waarin je elke stem die je je kunt voorstellen kunt ontwerpen, rechtstreeks vanaf je toetsenbord.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.