FreyaTTS Technical Report
Freya-TTS est un modèle de synthèse vocale compact, sans tokenizer et priorisant le turc, qui exploite un Transformer de diffusion par appariement de flux conditionnel non autorégressif dans un espace latent continu afin d'atteindre une synthèse conversationnelle de haute qualité et en temps réel avec une efficacité et une précision supérieures par rapport aux systèmes open-source plus volumineux.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous vouliez construire un robot capable de parler turc. La plupart des gens essaient de construire ce robot en lui enseignant un dictionnaire massif de sons, en décomposant chaque mot en de minuscules morceaux prédéfinis (comme des briques de LEGO), puis en empilant ces briques les unes sur les autres, de gauche à droite. C'est ainsi que fonctionnent beaucoup de robots vocaux « de pointe » actuels. Ils sont énormes, leur construction prend un temps infini, et s'ils trébuchent sur une phrase longue, ils perdent souvent pied, mélangeant les chiffres ou se trompant dans l'ordre.
L'équipe de FreyaTTS a décidé d'essayer une approche complètement différente, beaucoup plus petite et plus intelligente. Ils n'ont pas construit un dictionnaire géant ou un empileur de briques. À la place, ils ont construit un « moteur d'imagination » de 183,2 millions de paramètres qui apprend à parler le turc en écoutant l'audio et en devinant la phrase entière d'un seul coup, comme un musicien de jazz improvisant un solo complet plutôt que de lire une partition note après note.
Voici comment fonctionne leur tour de magie, décomposé en trois parties simples :
1. Le plan figé (L'« AudioVAE2 »)
Considérez l'équipe de FreyaTTS comme des architectes qui ont trouvé une maison pré-construite parfaite (appelée AudioVAE2) qui sait déjà transformer un croquis en une belle onde sonore de 48 kHz. Cette maison est si bonne que l'équipe a décidé de ne jamais y toucher. Ils l'ont figée en place.
Parce qu'ils n'ont pas eu à perdre de temps à apprendre au robot comment produire des ondes sonores, ils ont pu utiliser 100 % de leur puissance cérébrale pour apprendre au robot quoi dire. Ils n'avaient pas besoin d'un traducteur (un phonémiseur) pour transformer les lettres en sons, et ils n'avaient pas besoin de décomposer les mots en minuscules jetons sonores. Ils ont simplement nourri le robot de texte brut en turc (92 symboles, incluant des lettres spéciales comme ç, ğ, ı, ö, ş, ü) et l'ont laissé comprendre la prononciation par lui-même. C'est comme enseigner à un enfant à parler en lui parlant, plutôt qu'en lui donnant un manuel de phonétique.
2. La magie du « Tout-en-un » (Non-autorégressif)
La plupart des robots vocaux sont comme des dactylographes lents : ils tapent une lettre, puis la suivante, puis la suivante. S'ils commettent une erreur au début, toute la phrase devient incohérente. C'est ce qu'on appelle la génération « autorégressive ».
FreyaTTS est différent. C'est comme un peintre qui voit toute la toile et peint l'image entière d'un seul coup. Il utilise un transformateur de diffusion par correspondance de flux conditionnel (conditional flow-matching Diffusion Transformer) pour prédire le motif sonore de toute la phrase en parallèle.
- L'analogie : Imaginez que vous essayez de deviner la voix d'un ami. Au lieu de deviner un mot à la fois (ce qui pourrait vous amener à deviner le mauvais mot et gâcher la phrase), FreyaTTS devine le rythme et le ton de la phrase entière simultanément.
- Le résultat : Cela évite l'« accumulation d'erreurs de gauche à droite ». Si vous lui demandez de prononcer une longue liste de chiffres, il ne s'embrouille pas au milieu du chemin. Il prédit toute la durée et tout le motif sonore simultanément.
3. Le « Verrouillage de la Voix » (Pour la cohérence)
Lorsqu'ils ont entraîné ce robot de zéro pour la première fois, il était un peu caméléon. Chaque fois que vous lui demandiez de dire « Bonjour », il sonnait comme une personne différente. Une fois, il pouvait avoir une voix grave d'homme, la fois suivante, une voix aiguë d'enfant. C'est parce que le robot apprenait à partir d'un mélange de nombreuses voix et n'avait pas d'identité spécifique.
Pour corriger cela, l'équipe a procédé à un « verrouillage de la voix » en deux étapes :
- Étape 1 : Ils ont appris au robot à imiter une personne spécifique (un talent vocal professionnel unique). Cela a fait passer la variation de la hauteur de voix du robot d'un intervalle sauvage de 74,9 Hz à un intervalle stable de 5,0 Hz. Désormais, il sonne comme la même personne à chaque fois.
- Étape 2 : Ils ont réalisé que le robot était mauvais pour les phrases courtes (comme « Oui » ou « Non »). Ils lui ont donc donné un entraînement supplémentaire spécifiquement sur des phrases courtes d'un ou deux mots.
Les Résultats : Petit mais Puissant
L'équipe a testé son robot contre d'autres modèles de parole open-source célèbres. Voici ce qu'ils ont trouvé :
- Taille : FreyaTTS est minuscule (183,2M de paramètres) comparé aux géants comme XTTS-v2 (470M) ou F5-TTS (336M).
- Précision : Sur un test de 495 phrases en turc, FreyaTTS a commis moins d'erreurs que les modèles plus volumineux. Il a obtenu un taux d'erreur de mots (WER) de 8,0 % et un taux d'erreur de caractères (CER) de 3,0 %.
- Note : Les modèles plus grands ont obtenu respectivement 11,1 % et 24,3 %.
- Vitesse : Comme il n'a pas besoin d'attendre qu'un mot soit terminé avant de commencer le suivant, il est incroyablement rapide. Sur une carte graphique grand public standard, il fonctionne à un facteur de temps réel de 0,11. Cela signifie qu'il peut générer 10 secondes d'audio en seulement 1,1 seconde.
- Puissance d'ordinateur portable : Il est si efficace qu'il peut fonctionner plus vite que le temps réel sur le processeur d'un ordinateur portable (comme un Apple M3), ce qui le rend parfait pour les téléphones ou les petits appareils.
Ce qu'ils affirment explicitement ne PAS être
L'article est très clair sur ce que FreyaTTS n'est pas :
- Ce n'est pas un cloneur « zero-shot » capable d'imiter n'importe quelle voix à partir d'un extrait sonore. C'est un modèle à voix unique. Vous obtenez la voix unique sur laquelle il a été entraîné, et c'est tout.
- Ce n'est pas construit sur une base multilingue massive qui tente de parler 50 langues à la fois. C'est un modèle priorité au turc, spécialisé pour une seule langue.
- Il n'utilise pas de « phonémiseur » (un système basé sur des règles pour convertir les lettres en sons). Il apprend les sons directement à partir de l'audio.
- Il n'est pas parfait pour lire les nombres sous leur forme écrite (comme « 1999 »). L'article note qu'il faut toujours développer les nombres en leur forme parlée (comme « mille neuf cent quatre-vingt-dix-neuf ») avant de les injecter dans le modèle, car le robot rencontre parfois des difficultés avec la durée des longues suites de chiffres.
À quel point sont-ils sûrs ?
L'équipe est très confiante dans ces chiffres car elle n'a pas fait que deviner ; elle a tout mesuré.
- Ils ont construit un benchmark spécifique appelé Freya-TR-Eval comprenant 495 phrases.
- Ils ont lancé les tests 10 000 fois en utilisant une méthode de « bootstrap » pour s'assurer que les résultats n'étaient pas dus à la chance.
- Ils ont comparé leur modèle avec les mêmes phrases en utilisant exactement les mêmes règles de notation (en faisant redescendre tout le monde à 8 kHz pour que le terrain de jeu soit équitable).
- Ils ont même mesuré la stabilité du « verrouillage de la voix », montant la preuve que la variation de hauteur de voix est passée de 74,9 Hz à 5,0 Hz après leurs étapes d'entraînement.
En résumé, FreyaTTS prouve que vous n'avez pas besoin d'un monstre multilingue valant des milliards de dollars pour créer une excellente parole en turc. Vous pouvez construire un petit moteur spécialisé, « tout-en-un », qui tourne sur un ordinateur portable, sonne de manière cohérente et parle le turc mieux que les géants.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.