← Derniers articles
⚡ electrical engineering

UniVoice: A Unified Model for Speech and Singing Voice Generation

UniVoice est un cadre de génération de voix parlée et chantée unifié basé sur l'appariement de flux conditionnel qui factorise le conditionnement en contenu, mélodie et timbre, utilisant un jeton de mélodie nulle appris pour permettre un contrôle explicite de la mélodie pour le chant tout en permettant une inférence de prosodie naturelle pour la parole.

Auteurs originaux : Junjie Zheng, Huixin Xue, Shihong Ren, Chaofan Ding, Hao Liu, Zihao Chen

Publié 2026-06-05
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Junjie Zheng, Huixin Xue, Shihong Ren, Chaofan Ding, Hao Liu, Zihao Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un seul robot à accomplir deux tâches très différentes : raconter une histoire (parler) et interpréter un opéra (chanter).

D'habitude, vous construiriez deux robots distincts. L'un est conçu pour sonner de manière naturelle et conversationnelle, en suivant le rythme des mots qu'il lit. L'autre est conçu pour suivre une partition musicale stricte, en frappant chaque note et chaque temps exactement comme écrit.

Le problème quand on essaie de construire un seul robot pour faire les deux, c'est que les instructions des deux tâches se contredisent.

  • Pour chanter, vous devez forcer le robot à suivre une mélodie spécifique (comme un train sur des rails).
  • Pour parler, si vous forcez le robot à suivre une voie, il semble robotique et peu naturel. Il doit être libre de dériver selon l'émotion de l'histoire.

Si vous mélangez simplement les données d'entraînement, le robot devient confus. Il essaie de suivre la voie quand il devrait être libre, et il essaie d'être libre quand il devrait suivre la voie. Le résultat est généralement médiocre pour les deux tâches.

La Solution : UniVoice

Les chercheurs ont créé UniVoice, un nouveau « robot » (un modèle informatique) qui résout ce problème grâce à une astuce ingénieuse appelée Conditionnement Factorisé. Considérez cela comme le fait de donner au robot trois boutons de réglage séparés au lieu d'un seul gros interrupteur désordonné.

Voici comment fonctionnent ces trois boutons :

  1. Le bouton du Contenu (ce qui est dit) : Il lit les paroles ou le texte. C'est la même chose pour la parole et le chant.
  2. Le bouton du Timbre (qui parle) : Il écoute un court échantillon de la voix d'une personne (comme un clip de 5 secondes) pour copier son grain de voix unique, qu'elle soit en train de chuchoter ou de pousser une note puissante.
  3. Le bouton de la Mélodie (l'air) : C'est la partie magique.
    • Pour Chanter : Vous branchez une partition musicale spécifique (notes MIDI). Le robot doit suivre cette piste.
    • Pour Parler : Au lieu de brancher une piste, vous branchez un « Token Nul » spécial. Considérez cela comme un panneau « Ne pas déranger » pour la mélodie. Cela dit au robot : « Ignore la piste musicale, écoute simplement les mots et trouve ton propre rythme par toi-même. »

Le Moteur : Un Cerveau Partagé

Sous le capot, UniVoice utilise un moteur puissant appelé Transformer de Diffusion (DiT). Imaginez cela comme un artiste hautement qualifié capable de peindre n'importe quoi.

  • Par le passé, vous auriez pu avoir besoin de deux artistes différents (un pour la parole, un pour le chant).
  • UniVoice utilise un seul artiste qui est très doué pour écouter les trois boutons de réglage.
  • Lorsque le « Bouton de la Mélodie » est réglé sur le « Token Nuel », l'artiste sait improviser le rythme naturellement. Quand le bouton est réglé sur une chanson spécifique, l'artiste suit la partition parfaitement.

Pourquoi c'est important (Les Résultats)

Les chercheurs ont testé cela sur une quantité massive de données (30 000 heures de parole et 35 000 heures de chant). Voici ce qu'ils ont trouvé :

  • C'est un maître dans les deux domaines : UniVoice parle presque aussi bien que les meilleurs robots dédiés à la parole (comme F5-TTS) et chante bien mieux que les précédents robots « tout-en-un ».
  • C'est efficace : Il accomplit tout cela avec une taille relativement petite (0,3 milliard de paramètres), alors que les anciens modèles unifiés étaient beaucoup plus grands et moins performants.
  • Le « Token Nul » fonctionne : Ils ont prouvé que l'utilisation de ce panneau « Ne pas déranger » pour la parole est mathématiquement la bonne façon de permettre au modèle d'ignorer la mélodie sans briser sa capacité à chanter plus tard.

Le Nouveau Test : UNISINGING-EVAL

Pour s'assurer que leur robot était vraiment performant, l'équipe a construit un nouveau test appelé UNISINGING-EVAL. Imaginez un concours de talents avec 12 genres musicaux différents (de la Pop au Jazz en passant par le Hip-Hop). Ils ont testé le robot pour voir s'il pouvait passer de la parole au chant tout en conservant la même voix et en gérant différents styles.

L'essentiel à retenir

UniVoice est comme un acteur de doublage universel. Il n'a pas besoin d'être réentraîné ou d'avoir un cerveau différent pour la parole versus le chant. Il regarde simplement les instructions :

  • « Voici le texte, voici la voix, et voici une chanson » -> Chante parfaitement.
  • « Voici le texte, voici la voix, et voici pas de chanson » -> Parle naturellement.

En séparant les instructions, ils ont empêché le robot de devenir confus, lui permettant d'être excellent dans les deux tâches simultanément.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →