Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models
Wan-Streamer est un modèle de fondation interactif de streaming natif, de bout en bout, qui unifie le traitement du langage, de l'audio et de la vidéo au sein d'un seul Transformer pour parvenir à une communication multimodale en duplex intégral et en moins d'une seconde avec une latence côté modèle d'environ 200 ms, éliminant ainsi l'accumulation d'erreurs et les délais inhérents aux systèmes en cascade traditionnels.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous discutez avec un ami. Vous n'attendez pas qu'il termine sa phrase entière pour réfléchir, puis commencer à parler. Au lieu de cela, vous l'écoutez pendant qu'il parle, vous hochez la tête, vous établissez un contact visuel, vous l'interrompez peut-être avec un « Attends, vraiment ? » ou un rire, et vous commencez à former votre réponse pendant qu'il parle encore. C'est une interaction en full-duplex : tout se passe en même temps, de manière superposée et fluide.
Pendant longtemps, les ordinateurs ont été terribles pour cela. Ils fonctionnent généralement comme une course de relais avec des coureurs distincts :
- Le Coureur A écoute votre voix et la transforme en texte (Speech-to-Text).
- Le Coureur B lit le texte et réfléchit à une réponse (Le Cerveau).
- Le Coureur C transforme cette réponse en parole (Text-to-Speech).
- Le Coureur D prend cette parole et anime un visage pour correspondre aux mots (Génération Vidéo).
Au moment où la réponse parvient à vos oreilles, il y a un certain décalage, et l'ordinateur manque souvent vos expressions faciales ou vous interrompt maladroitement parce que les « coureurs » ne peuvent pas communiquer entre eux assez vite.
Wan-Streamer est un nouveau type d'IA qui essaie d'être un seul humain super rapide au lieu d'une équipe de relais. Voici comment cela fonctionne, en utilisant des analogies simples :
1. Le « Musicien Solo » vs L'« Orchestre »
La plupart des systèmes actuels sont comme un orchestre où le violoniste, le batteur et le chanteur sont dans des pièces différentes. Ils doivent attendre un signal pour commencer leur partie. Si le batteur est lent, toute la chanson traîne.
Wan-Streamer est comme un musicien solo qui joue de la guitare, chante et garde le rythme, tout cela à la fois. Il n'a pas de modules séparés pour écouter, réfléchir, parler ou bouger son visage. C'est un seul « cerveau » (un modèle Transformer) qui voit votre vidéo, entend votre voix et lit votre texte en même temps, et décide immédiatement quoi dire, comment sonner et comment bouger son visage simultanément.
2. Le « Penseur » et le « Performeur »
Pour rendre cela incroyablement rapide, les créateurs ont divisé le travail en deux rôles qui travaillent en parfaite synchronisation, comme un chef d'orchestre et un musicien :
- Le Penseur : Cette partie vous écoute, comprend ce que vous dites et planifie la réponse. C'est comme le chef d'orchestre décidant de la note suivante.
- Le Performeur : Cette partie prend le plan et crée réellement le son et la vidéo. C'est comme le musicien jouant de l'instrument.
Voici le tour de magie : Pendant que le Performeur est occupé à créer la vidéo et l'audio pour votre réponse actuelle, le Penseur est déjà en train d'écouter votre phrase suivante et de planifier la réponse suivante. Ils se passent le témoin si vite qu'il n'y a aucun temps d'attente. Cela permet au système de suivre une conversation en temps réel sans se figer.
3. Le « Flux en Direct » vs Le « Film Monté »
Les anciens systèmes vidéo d'IA sont comme le montage d'un film : ils attendent que toute la scène soit filmée, puis ils l'assemblent. Si vous voulez changer une réplique, ils doivent tout remonter.
Wan-Streamer est comme un journal télévisé en direct. Il génère la vidéo image par image, au fur et à mesure qu'elle se produit.
- Si vous arrêtez de parler, l'IA ne se fige pas ; elle continue de « respirer », de cligner des yeux et de vous regarder, tout comme une vraie personne attendant que vous continuiez.
- Si vous interrompez l'IA, elle s'arrête immédiatement et écoute, plutôt que de finir sa phrase parce qu'elle est « verrouillée ».
- Elle réagit à vos expressions faciales instantanément. Si vous avez l'air confus, elle peut ralentir ou s'expliquer, le tout en une fraction de seconde.
4. À quelle vitesse est-ce ?
L'article affirme que ce système est incroyablement rapide :
- Le temps du « Cerveau » de l'IA : Il faut environ 200 millisecondes (0,2 seconde) pour que l'IA vous entende, réfléchisse et commence à générer une réponse. C'est plus rapide qu'un clin d'œil humain.
- Le temps total de la conversation : Si l'on ajoute le temps nécessaire pour que le signal internet fasse l'aller-retour (environ 350 ms), le délai total est d'environ 550 millisecondes (0,55 seconde).
Pour mettre cela en perspective : Si vous parliez à un ami lors d'un appel vidéo avec un délai de 0,5 seconde, vous le remarqueriez à peine. Vous pourriez l'interrompre, et il réagirait naturellement.
Qu'est-ce qui le rend spécial ?
L'article souligne que Wan-Streamer ne se contente pas de « coller » différents outils ensemble. Il a appris à écouter, parler et bouger son visage en même temps dès le début.
- Pas de « Mandataire de Texte » : Il n'a pas besoin de transformer votre voix en texte, puis de la voix en voix. Il comprend directement le son et la vidéo.
- Rythme Naturel : Parce qu'il apprend de vraies conversations où les gens se coupent la parole, il sait quand faire une pause, quand hocher la tête et quand intervenir. Il ne semble pas robotique ou rigide.
L'essentiel
Wan-Streamer est un prototype d'humain numérique capable de tenir une véritable conversation face à face avec vous. Il ne se contente pas de répondre à des questions ; il vous regarde, vous écoute et réagit à vous avec un visage et une voix qui semblent vivants, tout en maintenant la fluidité de la conversation sans pauses gênantes. C'est un pas vers une IA qui ressemble moins à un programme informatique et plus à une personne assise en face de vous à la même table.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.