← Nieuwste papers
⚡ electrical engineering

dots.tts Technical Report

Het artikel introduceert dots.tts, een continu autoregressief TTS-fundamentmodel met 2 miljard parameters dat state-of-the-art prestaties bereikt in meertalige spraakgeneratie, stemklonering en emotionele expressiviteit door innovaties in AudioVAE-training, full-history conditioning en beloningsvrije zelfcorrectie, terwijl het ook lage-latentie inferentie biedt via MeanFlow-distillatie en alle code en checkpoints open-source beschikbaar stelt.

Oorspronkelijke auteurs: Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, Kai Yu

Gepubliceerd 2026-06-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, Kai Yu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Een Nieuw Soort Stemacteur

Stel je voor dat je een robot wilt bouwen die elke taal kan spreken, klinkt als elk mens en elke emotie kan uitdrukken. Een lange tijd werkten de meeste stemrobots als een morsecode-machine. Ze moesten woorden eerst vertalen naar een beperkte lijst van "geluidblokken" (discrete tokens) voordat ze konden spreken. Dit was efficiënt, maar het betekende dat de robot de subtiele, vloeiende nuances van menselijke spraak niet kon vangen, zoals een lichte ademhaling, een unieke lach of een complexe melodie tijdens het zingen.

dots.tts is een nieuw AI-model met 2 miljard parameters dat de "geluidblokken" overboord gooit. In plaats daarvan behandelt het spraak als water dat in een rivier stroomt (een continue stroom). Het hakt de spraak niet in stukjes; het voorspelt de volgende kleine druppel water in de stroom, wat zorgt voor een veel soepelere, natuurlijkere en expressievere stem.

Hoe het Werkt: Het Drieluik-Orkest

Het paper beschrijft dots.tts als een drieledig team dat samenwerkt om deze vloeiende stem te creëren:

  1. De Vertaler (AudioVAE):
    Beschouw dit als een camera en projector met een hoge resolutie. Het neemt ruwe geluidsgolven en comprimeert deze tot een "geheime taal" (een continue latente ruimte) die de computer kan begrijpen.
    • De Innovatie: Normaal gesproken zijn deze geheime talen rommelig. Het dots.tts-team heeft deze vertaler getraind met behulp van een speciale "leraar" (WavLM) om ervoor te zorgen dat de geheime taal alle emotionele en akoestische details intact houdt, waardoor het voor het volgende deel van het team makkelijker wordt om te lezen.

2. De Verhalenverteller (LLM):**
Dit is het brein van de operatie, gebaseerd op een tekst-AI (Qwen2.5). Het leest de tekst die je typt en plant wat er gezegd moet worden.
* De Innovatie: In plaats van de verhalenverteller de ruwe, rommelige audio te voeren, heeft het team een Semantische Encoder gebouwd. Deze werkt als een "samenvattende notitie". Het vertelt de verhalenverteller: "De afgelopen paar seconden aan audio waren blij en luid", zonder de verhalenverteller te overweldigen met technische ruis. Dit houdt de verhalenverteller gefocust op de betekenis, zodat hij niet in de war raakt tijdens lange zinnen.

  1. De Schilder (Flow-Matching Head):
    Dit is de kunstenaar die daadwerkelijk het geluid tekent. Het neemt het plan van de Verhalenverteller en de "samenvattende notities" van de voorgaande audio, en schildert vervolgens de volgende paar seconden geluid.
    • De Innovatie: Het team realiseerde zich dat als de schilder een kleine fout maakt, de volgende stap voortbouwt op die fout, waardoor de stem uit koers raakt (zoals bij het spelletje "telefoontje spelen"). Om dit op te lossen, gebruiken ze Full-History Conditioning. Stel je voor dat de schilder naar het volledige canvas kijkt dat hij tot nu toe heeft geschilderd, en niet alleen naar de laatste penseelstreek, om ervoor te zorgen dat het hele plaatje consistent blijft.

Het "Drift"-probleem Oplossen: De Zelfcorrigerende Lus

Zelfs met een goede schilder kunnen er fouten optreden bij lange zinnen. Het paper introduceert een slimme truc genaamd Reward-Free Self-Correction.

  • De Analogie: Stel je een student voor die leert tekenen. Meestal heeft deze een leraar nodig die zegt: "Die lijn is scheef." Hier is de AI zijn eigen leraar. Hij genereert een tekening, probeert vervolgens direct een klein deel ervan te "ongedaan te maken" en het opnieuw te tekenen, waarbij hij leert van zijn eigen fouten zonder dat er een mens nodig is om hem te beoordelen. Deze "zelfcorrigerende" training maakt de stem veel stabieler en minder geneigd om te haperen tijdens lange toespraken.

Versnellen: De "MeanFlow" Afkorting

Het genereren van vloeiend geluid is meestal traag omdat de computer veel kleine stappen moet nemen om het resultaat goed te krijgen.

  • De Analogie: Stel je voor dat je van je huis naar het park loopt. De oude manier is door 100 kleine, voorzichtige stappen te zetten. De nieuwe manier (genaamd MeanFlow Distillation) is alsof je een GPS hebt die zegt: "Zet 4 grote, zelfverzekerde passen om er te komen."
  • Het Resultaat: Het team is erin geslaagd het proces te comprimeren zodat de AI geluid kan genereren in slechts 2 tot 4 stappen in plaats van vele stappen. Hierdoor kan de stem ongelooflijk snel beginnen met spreken — in slechts 54 milliseconden (sneller dan een menselijke knipoog) — wat het perfect maakt voor realtime gesprekken.

Wat Ze Hebben Bereikt (Het Scorebord)

Het team heeft dots.tts getest tegenover de beste bestaande stemsystemen (zoals CosyVoice, Seed-TTS en commerciële producten) op verschillende uitdagingen:

  • Nauwkeurigheid: Het maakte zeer weinig fouten in wat het zei (lage Word Error Rate) en versloeg bijna iedereen op standaardtests.
  • Stemklonen: Als je het een fragment van 3 seconden van een persoon geeft, kan het deze persoon zo goed nabootsen dat het op "gelijkenis" hoger scoort dan elk ander open-source model.
  • Meertaligheid: Het spreekt vloeiend 24 talen en behoudt de stem van de spreker, zelfs wanneer er van taal wordt gewisseld.
  • Expressiviteit: Het handelt complexe taken zoals zingen, emotionele dialogen en paralinguïstische geluiden (zoals zuchten of lachen) beter af dan eerdere modellen die vertrouwen op "geluidblokken".

De Kernboodschap

dots.tts is een doorbraak omdat het bewijst dat je spraak niet in kleine, rigide stukjes hoeft te hakken om een stem-AI te maken. Door spraak te behandelen als een continue stroom en de AI tools te geven om zichzelf te corrigeren en naar het "grotere geheel" te kijken, hebben ze een systeem gecreëerd dat:

  1. Natuurlijker is (vloeiend als water, niet blokkerig).
  2. Stabieler is (dwaalt niet af tijdens lange gesprekken).
  3. Snel genoeg is voor realtime chatten.

Het team heeft al hun code en modellen gratis vrijgegeven, zodat iedereen kan voortbouwen op deze "continue" benadering van stemtechnologie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →