← Nieuwste papers
💬 NLP

FreyaTTS Technical Report

Freya-TTS is een compact, tokenizer-vrij, Turks-georiënteerd tekst-naar-spraakmodel dat een niet-autoregressieve conditional flow-matching Diffusion Transformer in een continue latente ruimte benut om hoogwaardige, real-time conversationele synthese te bereiken met een superieure efficiëntie en nauwkeurigheid vergeleken met grotere open-source systemen.

Oorspronkelijke auteurs: Ahmet Erdem Pamuk, Ömer Yentür, Ahmet Tunga Bayrak, Yavuz Alp Sencer Öztürk, Mustafa Yavuz

Gepubliceerd 2026-07-13
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ahmet Erdem Pamuk, Ömer Yentür, Ahmet Tunga Bayrak, Yavuz Alp Sencer Öztürk, Mustafa Yavuz

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot wilt bouwen die Turks spreekt. De meeste mensen proberen deze robot te bouwen door het een enorme woordenlijst van klanken aan te leren, waarbij elk woord wordt opgedeeld in piepkleine, vooraf gedefinieerde stukjes (zoals Lego-steentjes), en die steentjes vervolgens één voor één van links naar rechts op elkaar stapelt. Dit is hoe veel huidige "state-of-the-art" spraakrobots werken. Ze zijn enorm, het duurt een eeuwigheid om ze te bouwen, en als ze struikelen over een lange zin, gaan ze vaak over hun eigen voeten en raken ze de draad kwijt, waarbij ze cijfers door elkaar halen of de volgorde fout doen.

Het FreyaTTS-team besloot een totaal andere, veel kleinere en slimmere aanpak te proberen. Ze hebben geen gigantische woordenlijst of een stukje-voor-stukje stapelaar gebouwd. In plaats daarvan bouwden ze een 183,2-miljoen-parameter "imaginatie-motor" die leert Turks te spreken door naar audio te luisteren en de hele zin in één keer te raden, net zoals een jazzmuzikant een volledige solo improviseert in plaats van noot voor noot een partituur te lezen.

Hier is hoe hun tovertruc werkt, opgedeeld in drie eenvoudige delen:

1. Het Bevroren Blauwdruk (De "AudioVAE2")

Denk aan het FreyaTTS-team als architecten die een perfect, vooraf gebouwd huis hebben gevonden (genaamd AudioVAE2) dat al weet hoe het een schets in een prachtige 48 kHz geluidsgolf kan veranderen. Dit huis is zo goed dat het team besloot nooit aan te raken. Ze hebben het op zijn plaats bevroren.

Omdat ze geen tijd hoefden te verspillen aan het leren van de robot hoe hij geluidsgolven moet maken, konden ze 100% van hun hersencapaciteit gebruiken om de robot te leren wat hij moet zeggen. Ze hadden geen vertaler (een fonemizer) nodig om letters in klanken om te zetten, en ze hoefden woorden ook niet in kleine klanktokens op te breken. Ze voerden de robot gewoon ruwe Turkse tekst (92 symbolen, inclusief speciale letters zoals ç, ğ, ı, ö, ş, ü) en lieten hem de uitspraak zelf uitzoeken. Het is alsoals een kind leren spreken door tegen het kind te praten, in plaats van een tekstboek over fonetiek te geven.

2. De "Alles-in-één" Magie (Niet-autoregressief)

De meeste spraakrobots zijn als een trage typist: ze typen één letter, dan de volgende, dan de volgende. Als ze vroeg in de zin een fout maken, raakt de hele zin onverstaanbaar. Dit wordt "autoregressieve" generatie genoemd.

FreyaTTS is anders. Het is als een schilder die het hele canvas ziet en het hele schilderij in één keer schildert. Het gebruikt een conditional flow-matching Diffusion Transformer om het hele geluidspatroon van de zin parallel te voorspellen.

  • De Analogie: Stel je voor dat je de stem van een vriend probeert te raden. In plaats van één woord tegelijk te raden (wat ertoe kan leiden dat je het verkeerde woord raadt en de zin verpest), raadt FreyaTTS het volledige ritme en toon van de zin in één keer.
  • Het Resultaat: Het voorkomt "links-naar-rechts foutaccumulatie". Als je het vraagt om een lange lijst met getallen te zeggen, raakt het halverwege niet in de war. Het voorspelt de volledige duur en het volledige geluidspatroon gelijktijdig.

3. De "Stem-Lock" (Voor Consistentie Zorgen)

Toen ze deze robot voor het eerst vanaf nul trainden, was het een beetje een kameleon. Elke keer als je de robot vroeg om "Hallo" te zeggen, klonk het als een ander persoon. De ene keer klonk het als een man met een diepe stem, de andere keer als een hoog pratend kind. Dit kwam omdat de robot leerde van een mix van vele stemmen en geen specifieke identiteit had.

Om dit op te lossen, deden het team een twee-staps "stem-lock":

  1. Fase 1: Ze leerden de robot om één specifiek persoon na te bootsen (één professionele stemacteur). Dit verkleinde de variatie in de toonhoogte van de stem van de robot van een wilde 74,9 Hz (een enorme range) naar een stabiele 5,0 Hz. Nu klinkt het elke keer als dezelfde persoon.
  2. Fase 2: Ze realiseerden zich dat de robot slecht was in korte zinnen (zoals "Ja" of "Nee"). Dus gaven ze het extra oefening, specifiek op korte één- of twee-woordige zinnen.

De Resultaten: Klein maar Krachtig

Het team heeft hun robot getest tegen andere beroemde open-source spraakmodellen. Dit is wat ze ontdekten:

  • Grootte: FreyaTTS is minuscuul (183,2M parameters) vergeleken met reuzen zoals XTTS-v2 (470M) of F5-TTS (336M).
  • Nauwkeurigheid: In een test met 495 Turkse zinnen maakte FreyaTTS minder fouten dan de grotere modellen. Het behaalde een Word Error Rate (WER) van 8,0% en een Character Error Rate (CER) van 3,0%.
    • Opmerking: De grotere modellen behaalden respectievelijk 11,1% en 24,3%.
  • Snelheid: Omdat het niet hoeft te wachten tot het ene woord klaar is voordat het aan het volgende begint, is het ongelooflijk snel. Op een standaard consumentengrafische kaart draait het met een real-time factor van 0,11. Dit betekent dat het 10 seconden audio kan genereren in slechts 1,1 seconde.
  • Laptop Kracht: Het is zo efficiënt dat het sneller dan real-time kan draaien op een laptop CPU (zoals een Apple M3), waardoor het perfect is voor telefoons of kleine apparaten.

Wat Ze Expliciet Zeggen Dat Het NIET Is

Het paper is heel duidelijk over wat FreyaTTS niet is:

  • Het is geen "zero-shot" kloner die elke stem kan nabootsen die je het via een fragment geeft. Het is een single-voice model. Je krijgt de ene stem waarop het getraind is, en dat is alles.
  • Het is niet gebouwd op een enorme meertalige basis die probeert 50 talen tegelijk te spreken. Het is een Turks-gericht model, gespecialiseerd voor één taal.
  • Het gebruikt geen "phonemizer" (een regelgebaseerd systeem om letters in klanken om te zetten). Het leert de klanken direct van de audio.
  • Het is niet perfect in het lezen van getallen in hun geschreven vorm (zoals "1999"). Het paper merkt op dat je nog steeds getallen moet uitbreiden naar hun gesproken vorm (zoals "één duizend negenhonderd negenen negentig") voordat je ze aan het model voert, omdat de robot soms moeite heeft met de duur van lange reeksen cijfers.

Hoe Zeker Zijn Ze?

Het team is zeer zelfverzekerd over deze cijfers omdat ze niet alleen gegokt hebben; ze hebben alles gemeten.

  • Ze bouwden een specifieke benchmark genaamd Freya-TR-Eval met 495 zinnen.
  • Ze voerden de tests 10.000 keer uit met een "bootstrap"-methode om er zeker van te zijn dat de resultaten niet op toeval berustten.
  • Ze vergeleken hun model met exact dezelfde zinnen met exact dezelfde scoringsregels (door alles te downsamplen naar 8 kHz zodat het speelveld gelijkwaardig was).
  • Ze maten zelfs de stabiliteit van de "stem-lock", waarbij ze lieten zien dat de variatie in toonhoogte daalde van 74,9 Hz naar 5,0 Hz na hun trainingsstappen.

Kortom, FreyaTTS bewijst dat je geen miljarden kostende, meertalige monster nodig hebt om geweldige Turkse spraak te maken. Je kunt een kleine, gespecialiseerde, "alles-in-één" motor bouwen die op een laptop draait, consistent klinkt en beter Turks spreekt dan de reuzen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →