← Nieuwste papers
⚡ electrical engineering

OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models

OmniVoice is een revolutionair, op open-source data getraind zero-shot tekst-naar-spraakmodel dat met een innovatieve diffusietaalmodel-architectie meer dan 600 talen ondersteunt en state-of-the-art prestaties levert door tekst direct naar akoestische tokens te vertalen.

Oorspronkelijke auteurs: Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Povey

Gepubliceerd 2026-04-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Povey

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

OmniVoice: De "Alwetende Verteller" voor de Wereld

Stel je voor dat je een magische stem hebt die niet alleen Nederlands of Engels spreekt, maar 600 verschillende talen vloeiend kan spreken. En het beste deel? Je hoeft die stem niet maandenlang te trainen. Je geeft haar gewoon een paar seconden van een opname van een ander, en poef – ze spreekt die taal met precies datzelfde accent en diezelfde klank.

Dat is OmniVoice, een nieuw computerprogramma van Xiaomi dat tekst omzet in spraak (Text-to-Speech). Maar in plaats van een simpele robotstem, is dit een slimme, wereldwijde verteller. Hier is hoe het werkt, vertaald in alledaags taalgebruik.

1. Het Probleem: De "Tweestaps-Trap"

Vroeger waren slimme spraakcomputers als een bouwvakker die eerst een blauwdruk tekent (de betekenis van de tekst) en daarna pas de muren bouwt (de geluidsgolven).

  • Stap 1: De computer denkt na over wat er gezegd moet worden.
  • Stap 2: De computer bouwt het geluid op basis van die gedachten.

Het probleem? Als de computer in stap 1 een kleine fout maakt (bijvoorbeeld een verkeerd woord begrijpen), is het geluid in stap 2 al geruïneerd. Het is alsof je een huis bouwt op een scheve fundering; het ziet er misschien mooi uit, maar het klinkt niet goed. Veel bestaande systemen zitten vast in deze "tweestaps-trap" en kunnen maar een handjevol talen goed beheersen.

2. De Oplossing: De "Directe Telepathie"

OmniVoice doet het anders. Het slaat stap 1 en stap 2 over en doet alles in één keer.

  • De Analogie: Stel je voor dat je een brief schrijft en die direct in een stem omzet, zonder eerst een tussenstap van "gedachte" te maken. Het is alsof de computer direct telepathisch de tekst in geluid omzet.
  • Hoe? Het gebruikt een slimme techniek die lijkt op het invullen van een kruiswoordraadsel. De computer ziet de tekst en een stukje voorbeeldgeluid, en vult de ontbrekende stukjes van het geluid in alsof het een puzzel oplost. Dit heet een "diffusie-model", maar je kunt het zien als een kunstenaar die een schilderij niet stukje bij beetje schildert, maar het hele canvas in één keer tot leven wekt.

3. De Twee Geheime Ingrediënten

Om dit zo goed mogelijk te laten werken, hebben de makers twee trucjes gebruikt:

  • Truc 1: De "Willekeurige Verstoppeertjes" (Full-Codebook Random Masking)
    Normaal gesproken laten computers maar één laag van de geluidspuzzel zien per keer. Dat is traag, alsof je een raadsel oplost door maar één letter per minuut te raden.
    OmniVoice doet het anders: het verbergt alle stukjes van het geluid willekeurig en laat de computer ze allemaal tegelijk oplossen. Het is alsof je een hele kamer vol met puzzelstukjes gooit en de computer moet ze allemaal in één keer in de juiste hoekjes leggen. Dit maakt het leren veel sneller en het eindresultaat veel scherper.

  • Truc 2: De "Geniale Opleiding" (LLM Initialisatie)
    Vaak zijn spraakcomputers slim in geluid maken, maar niet in het begrijpen van taal (ze kunnen woorden verwarren).
    OmniVoice begint zijn leven niet als een lege doos. De makers hebben hem "opgeleid" met de kennis van een super-intelligente taalcomputer (een Large Language Model, zoals een slimme chatbot). Het is alsof je een stemacteur niet pas laat leren lezen, maar hem eerst een diploma in literatuur laat halen. Hierdoor spreekt OmniVoice niet alleen goed, maar klinkt het ook heel natuurlijk en verstaanbaar, zelfs in moeilijke talen.

4. De Wereldwijde Bibliotheek

De meeste spraakcomputers kennen alleen de grote talen (Engels, Chinees, Spaans). Talen van kleine volkeren of minder bekende dialecten worden vaak genegeerd.
OmniVoice is getraind op een enorme bibliotheek van 581.000 uur aan openbare audio-opnames.

  • Het Resultaat: Het spreekt nu 646 talen. Van het grote Engels tot zeldzame talen die maar een paar uur aan data hebben. Het is alsof je een vertaler hebt die elke taal op aarde kent, zelfs diegene die maar door een paar honderd mensen worden gesproken.

5. Extra Superkrachten

OmniVoice is niet alleen een vertaler; het is ook een regisseur:

  • Ruisbestendig: Als je een slechte opname geeft (bijvoorbeeld met achtergrondlawaai van een trein), kan OmniVoice die ruis "wegpoetsen" en een schone, heldere stem maken.
  • Stemontwerp: Je kunt zeggen: "Spreek als een oude man met een zwaar accent" of "Spreek als een blij kind", zonder dat je een opname van zo iemand nodig hebt.
  • Uitspraakcontrole: Als de computer twijfelt over een lastig woord (zoals een Chinees karakter met meerdere uitspraken), kun je het hem letterlijk vertellen hoe het moet klinken.

Conclusie

OmniVoice is de eerste keer dat we een spraakcomputer hebben die wereldwijd is, super snel leert, en elke taal (van de grootste tot de kleinste) met dezelfde kwaliteit kan nabootsen. Het breekt de muur tussen technologie en taal, zodat iedereen, waar ook ter wereld, toegang krijgt tot hoogwaardige spraaktechnologie.

Kortom: Het is alsof we een magische stem hebben gevonden die de hele wereld kan begrijpen en nabootsen, zonder dat we er jaren voor hoeven te studeren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →