← Nieuwste papers
⚡ electrical engineering

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

X-Voice is een lichtgewicht 0,4B meertalig zero-shot stemkloonmodel dat is getraind op een corpus van 420.000 uur met behulp van een nieuw tweestapsparadigma en architecturale verbeteringen om hoogwaardige spraaksynthese in 30 talen mogelijk te maken zonder transcripten voor audioprompts, waarbij prestaties worden bereikt die vergelijkbaar zijn met modellen op biljoen-schaal.

Oorspronkelijke auteurs: Rixi Xu, Qingyu Liu, Haitao Li, Yushen Chen, Zhikang Niu, Yunting Yang, Jian Zhao, Ke Li, Berrak Sisman, Qinyuan Cheng, Xipeng Qiu, Kai Yu, Xie Chen

Gepubliceerd 2026-05-08
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Rixi Xu, Qingyu Liu, Haitao Li, Yushen Chen, Zhikang Niu, Yunting Yang, Jian Zhao, Ke Li, Berrak Sisman, Qinyuan Cheng, Xipeng Qiu, Kai Yu, Xie Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je wilt leren spreken in 30 verschillende talen, maar je hebt geen leraar, geen lesboek en zelfs geen script. Je hebt alleen een korte opname van de stem van een vriend. X-Voice is een nieuw AI-model dat dit mogelijk maakt. Het is een "stemchameleont" dat de stem van je vriend kan nemen en die kan laten spreken in elk van de 30 talen, zelfs als je vriend die talen nooit eerder heeft gesproken.

Hieronder wordt uitgelegd hoe het artikel X-Voice uitlegt, opgesplitst in eenvoudige concepten:

1. Het Probleem: De "Script"-Flesnek

De meeste voice-cloning AI's van vandaag zijn als een strenge acteur die een script nodig heeft. Om een stem te klonen, heb je meestal twee dingen nodig:

  1. Een korte audio-opname van de persoon.
  2. Een transcriptie (een geschreven tekst) van precies wat ze in die opname zeiden.

Dit werkt uitstekend voor het Engels of Chinees, waar het krijgen van een geschreven transcriptie eenvoudig is. Maar voor veel andere talen (vooral zeldzame talen of dialecten) is het krijgen van een nauwkeurige transcriptie moeilijk of onmogelijk. Als je het script niet hebt, raakt de AI in de war en kan de stem niet goed worden gekloond.

2. De Oplossing: Een Tweefasige Trainingskamp

De onderzoekers bouwden X-Voice met een slimme "tweefasige" trainingsmethode, net als een meesterkok die een leerling opleidt.

  • Fase 1: De Meesterkok (X-Voice1)
    Eerst trainden ze een enorm model op 420.000 uur spraak uit 30 verschillende talen. Denk hierbij aan de "Meesterkok" die elk recept en elke smaak ter wereld kent. Dit model is zeer goed in spreken, maar het heeft nog steeds een script nodig om te weten wat het moet zeggen.

  • Fase 2: De Leerling (X-Voice2)
    Hier komt de magische truc. De onderzoekers gebruikten de "Meesterkok" om 10.000 uur nieuwe audio te genereren. Ze namen een echte stemopname, voerden die aan de Meesterkok en vroegen hem om een ander tekst te spreken.

    Vervolgens namen ze deze nieuwe audio-opnames en leerden het model een nieuwe les: "Negeer het script. Luister gewoon naar de stem." Ze trainden het model om de originele stem te reconstrueren met alleen de audio, waarbij de tekst volledig werd verborgen. Dit creëerde X-Voice2, het uiteindelijke model dat een stem kan klonen zonder ooit een transcriptie te hoeven lezen.

3. De Geheime Ingrediënt: "Dual-Level" Taalinjectie

Wanneer je een AI vraagt om een nieuwe taal te spreken met een oude stem, is een veelvoorkomend probleem "accentlek". Bijvoorbeeld: als je een Franse spreker vraagt om "Hallo" in het Japans te zeggen, kan de AI per ongeluk een Frans accent geven.

Om dit op te lossen, bedachten de onderzoekers een Dual-Level Taalinjectie-systeem. Stel je voor dat de AI twee verschillende "knoppen" heeft om de taal te controleren:

  • De Tekstknop: Vertelt de AI welke woorden hij moet zeggen.
  • De Tijdknop: Vertelt de AI wanneer hij ze moet zeggen en wat het ritme moet zijn.

Door beide knoppen tegelijkertijd te draaien, kan de AI de stem (het unieke geluid van de persoon) perfect scheiden van het accent (het ritme van de taal). Dit zorgt ervoor dat de persoon klinkt als zichzelf, maar de nieuwe taal correct spreekt.

4. Het Resultaat: Snel, Gratis en Vloeiend

Het artikel beweert dat X-Voice een "0,4B"-model is, wat betekent dat het relatief klein en lichtgewicht is in vergelijking met gigantische modellen die hele serverruimtes nodig hebben.

  • Snelheid: Omdat het de trage, stap-voor-stap "autoregressieve" methode niet gebruikt (zoals het schrijven van één woord per keer), kan het zeer snel spraak genereren.
  • Kwaliteit: In tests presteerde het net zo goed als enorme commerciële modellen (zoals Qwen3-TTS) die veel groter zijn, maar dan zonder transcripties nodig te hebben.
  • Open Source: Het team heeft al hun gegevens (de 420.000 uur audio) en de code gratis vrijgegeven, zodat iedereen het kan gebruiken.

Samenvattende Analogie

Denk aan X-Voice als een universele vertaler voor stemmen.

  • Oude AI: "Ik kan alleen je stem klonen als je deze specifieke zin voor me leest, en ik heb de geschreven tekst van die zin nodig."
  • X-Voice: "Ik kan je stem klonen vanuit slechts een 5-seconden clip van je die je neuriëert, en ik kan je direct laten spreken in 30 verschillende talen, zonder dat ik moet weten welke woorden je neuriëerde."

Het artikel concludeert dat deze technologie de grootste barrière voor meertalige voice-cloning wegneemt: de behoefte aan geschreven transcripties. Het stelt iedereen in staat om in iemands stem elke taal te spreken, mits ze een korte audio-opname hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →