← Nieuwste papers
⚡ electrical engineering

UniVoice: A Unified Model for Speech and Singing Voice Generation

UniVoice is een verenigd framework voor spraak- en zangstemgeneratie gebaseerd op conditional flow matching dat conditionering factoriseert in inhoud, melodie en timbre, waarbij een geleerd null-melodie-token wordt gebruikt om expliciete melodiecontrole voor zang mogelijk te maken terwijl natuurlijke prosodie-inferentie voor spraak wordt toegestaan.

Oorspronkelijke auteurs: Junjie Zheng, Huixin Xue, Shihong Ren, Chaofan Ding, Hao Liu, Zihao Chen

Gepubliceerd 2026-06-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Junjie Zheng, Huixin Xue, Shihong Ren, Chaofan Ding, Hao Liu, Zihao Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je één robot probeert te leren om twee heel verschillende taken te doen: een verhaal vertellen (spreken) en een opera op te voeren (zingen).

Normaal gesproken zou je twee aparte robots bouwen. Eén is ontworpen om natuurlijk en conversationeel te klinken, waarbij hij zijn ritme oppikt uit de woorden die hij leest. De andere is ontworpen om een strikte partituur te volgen, waarbij elke noot en elke tel exact volgens de bladmuziek wordt geraakt.

Het probleem met het proberen te bouwen van slechts één robot voor beide taken, is dat de instructies voor de twee taken elkaar tegenspreken.

  • Voor zingen moet je de robot dwingen om een specifieke melodie te volgen (zoals een trein op een spoor).
  • Voor spreken, als je de robot dwingt een spoor te volgen, klinkt hij robotachtig en onnatuurlijk. Hij moet vrij kunnen dwalen op basis van de emotie van het verhaal.

Als je de trainingsdata gewoon bij elkaar mengt, raakt de robot in de war. Hij probeert het spoor te volgen wanneer hij vrij zou moeten zijn, en probeert vrij te zijn wanneer hij het spoor zou moeten volgen. Het resultaat is meestal slecht in beide.

De Oplossing: UniVoice

De onderzoekers creëerden UniVoice, een nieuwe "robot" (een computermodel) die dit oplost door een slimme truc te gebruiken genaamd Factorized Conditioning. Denk hierbij aan het geven van drie aparte regelknoppen in plaats van één grote, rommelige schakelaar.

Zo werken deze drie knoppen:

  1. De Content-knop (Wat er gezegd wordt): Deze leest de tekst of de songtekst. Dit is hetzelfde voor zowel spreken als zingen.
  2. De Timbre-knop (Wie het zegt): Deze luistert naar een korte sample van iemands stem (zoals een clip van 5 seconden) om hun unieke geluid te kopiëren, of ze nu fluisteren of een hoge noot zingen.
  3. De Melody-knop (De melodie): Dit is het magische deel.
    • Bij Zingen: Je plugt een specifieke muzikale partituur in (MIDI-noten). De robot moet dit spoor volgen.
    • Bij Spreken: In plaats van een spoor in te pluggen, plug je een speciale "Null Token" in. Denk aan een "Niet Storen"-bordje voor de melodie. Het vertelt de robot: "Negeer het muziekspoor; luister alleen naar de woorden en bepaal zelf het ritme."

De Motor: Een Gedeelde Hersenen

Onder de motorkap gebruikt UniVoice een krachtige motor genaamd een Diffusion Transformer (DiT). Stel je dit voor als een zeer bekwame kunstenaar die alles kan schilderen.

  • In het verleden had je misschien twee verschillende kunstenaars nodig (één voor spraak en één voor zang).
  • UniVoice gebruikt één kunstenaar die heel goed is in het luisteren naar de drie regelknoppen.
  • Wanneer de "Melody-knop" op de "Null Token" staat, weet de kunstenaar dat hij het ritme natuurlijk moet improviseren. Wanneer de knop op een specifiek lied staat, volgt de kunstenaar de bladmuziek perfect.

Waarom dit Belangrijk Is (De Resultaten)

De onderzoekers hebben dit getest op een enorme hoeveelheid data (30.000 uur spraak en 35.000 uur zang). Dit is wat ze vonden:

  • Het is een meester in beide: UniVoice spreekt bijna net zo goed als de beste spraak-alleen robots (zoals F5-TTS) en zingt veel beter dan eerdere "alles-in-één" robots.
  • Het is efficiënt: Het doet dit allemaal met een relatief kleine omvang (0,3 miljard parameters), terwijl oudere verenigde modellen veel groter waren en nog slechter presteerden.
  • De "Null Token" werkt: Ze hebben bewezen dat het gebruik van dat speciale "Niet Storen"-bordje voor spraak wiskundig de juiste manier is om het model de melodie te laten negeren zonder dat dit later zijn vermogen om te zingen breekt.

De Nieuwe Test: UNISINGING-EVAL

Om te controleren of hun robot echt goed was, bouwde het team een nieuwe test genaamd UNISINGING-EVAL. Stel je een talentenjacht voor met 12 verschillende muziekgenres (van Pop tot Jazz tot Hip-Hop). Ze testten de robot om te zien of hij kon schakelen tussen spreken en zingen terwijl hij dezelfde stem behield en verschillende stijlen aankon.

De Kern van het Verhaal

UniVoice is als een universele stemacteur. Het hoeft niet opnieuw getraind te worden of een ander brein te hebben voor spreken versus zingen. Het kijkt simpelweg naar de instructies:

  • "Hier is de tekst, hier is de stem, en hier is een lied" -> Zingt perfect.
  • "Hier is de tekst, hier is de stem, en hier is geen lied" -> Spreekt natuurlijk.

Door de instructies te scheiden, voorkomden ze dat de robot in de war raakte, waardoor hij in staat is om in beide taken uitstekend te zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →