← Derniers articles
💻 computer science

Video = World + Event Stream

Le document présente Wan-Streamer v0.3, un modèle d'interaction audio-visuelle en temps réel qui cadre la vidéo comme une combinaison d'un « monde » persistant et d'un « flux d'événements » dynamique afin de permettre une prédiction à faible latence des changements environnementaux et des comportements d'agents à usage général.

Auteurs originaux : Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zh
Publié 2026-07-20
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardez un film, mais au lieu de simplement vous asseoir et regarder, vous êtes à l'intérieur de la scène, parlant aux personnages, et ils vous répondent instantanément. C'est le monde passionnant de l'intelligence artificielle en temps réel, où les ordinateurs tentent de nous comprendre et de nous répondre aussi vite qu'un ami humain le ferait. Pour ce faire, l'IA doit jongler avec trois éléments à la fois : ce qu'elle voit (la vidéo), ce qu'elle entend (l'audio) et ce qu'elle dit ou fait (le texte et les actions). Pendant longtemps, faire en sorte qu'une IA accomplisse tout cela sans latence revenait à essayer de courir un marathon en portant un sac à dos lourd ; c'était lent et maladroit. La grande question que les chercheurs se sont posée est la suivante : Comment pouvons-nous apprendre à une IA à comprendre la « scène » sur laquelle elle se trouve et l'« action » qui s'y déroule, afin qu'elle puisse réagir naturellement et instantanément ?

Découvrez Wan-Streamer v0.3, une nouvelle création de l'équipe Wan d'Alibaba Group. Considérez ce document comme une recette ingénieuse pour un acteur numérique super rapide et super intelligent. Les auteurs ont réalisé qu'au lieu de traiter une vidéo comme un immense et confus amas de pixels changeants, nous pouvons la décomposer en deux parties simples : un Monde et un Flux d'Événements. Le « Monde » est la partie stable — la pièce dans laquelle vous vous trouvez, les meubles, le visage de la personne et le bruit de fond. Cela ne change pas beaucoup. Le « Flux d'Événements » est tout ce qui change — la personne qui marche, parle, fait un signe de la main ou la voiture qui passe. En apprenant à l'IA que une vidéo est simplement un « Monde » plus un « flux d'événements », ils ont trouvé un moyen de rendre l'IA beaucoup plus intelligente et rapide pour prédire ce qui va se passer ensuite.

La Grande Idée : La Scène et la Pièce

Le document propose une nouvelle façon de voir la vidéo. Imaginez un théâtre. Le Monde est la scénographie : le décor peint, l'éclairage, les accessoires et le costume de l'acteur. Une fois que la pièce commence, ces éléments restent pour la plupart identiques. Le Flux d'Événements est la pièce elle-même : l'acteur traversant la scène, criant une réplique, faisant tomber un accessoire ou se retournant.

Par le passé, les modèles d'IA essayaient d'apprendre toute la pièce et toute la scénographie en même temps, ce qui était difficile. Wan-Streamer v0.3 suggère une astuce plus simple : enseigner la scénographie à l'IA une fois pour toutes, puis se concentrer uniquement sur la pièce.

Les chercheurs ont entraîné leur modèle sur une quantité massive de vidéos du monde réel. Ils n'ont pas seulement demandé à l'IA de deviner l'image suivante ; ils lui ont appris à regarder un « Monde » (comme une rue de banlieue ensoleillée ou un poulailler) puis à prédire le « Flux d'Événements » (comme un robot courant dans la rue ou une femme nourrissant des poules). Le modèle a appris que si un robot est sur un trottoir, il pourrait courir vers une voiture, ouvrir la porte et partir en conduisant. Si une femme est dans un poulailler, elle pourrait marcher vers un seau et ramasser de la nourriture. En apprenant ces schémas, l'IA construit une « connaissance du monde » sur la manière dont les choses bougent et changent de façon plausible.

Le Tour de Magie : Parler et Agir en même Temps

Alors, qu'est-ce que cela fait concrètement ? L'équipe a testé cette idée sur une interaction audio-visuelle en temps réel et en duplex intégral. Le « duplex intégral » est une façon sophistiquée de dire que l'IA peut parler et écouter en même temps, tout comme une véritable conversation, sans attendre que vous ayez fini.

Dans cette nouvelle version (v0.3), l'agent d'IA n'est pas seulement une tête parlante. Il peut désormais effectuer un comportement libre.

  • Ancienne méthode : L'IA pourrait simplement hocher la tête ou vous regarder pendant qu'elle parle.
  • Nouvelle méthode : L'IA peut dire : « (prend une tasse de café et prend une gorgée) Merci de me l'avoir rappelé » ou « (fronce légèrement les sourcils) Qu'avez-vous voulu dire par là ? ».

Le document explique que l'IA écrit sa réponse dans un format spécial de « jeu de rôle ». Elle mélange les paroles prononcées avec des actions écrites entre parenthèses. Parce que l'IA a appris le « Monde » (le cadre et le personnage), elle sait que si elle dit « (prend une tasse) », le générateur de vidéo montrera réellement le personnage en train de prendre une tasse qui correspond à la scène. Cela se produit en temps réel, et la parole, l'action et la vidéo restent parfaitement synchronisées.

La Vitesse : Assez Rapide pour paraître Réel

L'une des parties les plus impressionnantes de ce document est qu'ils n'ont pas sacrifié la vitesse pour cette nouvelle intelligence. Les auteurs démontrent que Wan-Streamer v0.3 conserve les performances ultra-rapides de leur version précédente (v0.2).

  • Qualité Vidéo : Il produit toujours une vidéo en résolution 640×368.
  • Fluidité : Il fonctionne à 25 FPS (images par seconde), ce qui est assez fluide pour paraître naturel.
  • Vitesse : L'IA prend environ 200 millisecondes pour réfléchir et générer une réponse par elle-même. Si l'on ajoute le temps nécessaire pour que l'internet renvoie les données (un budget de 350 millisecondes), le temps total d'attente pour une réponse est d'environ 550 millisecondes.

Pour mettre cela en perspective, 550 millisecondes est moins d'une seconde. C'est assez rapide pour que la conversation ressemble à une discussion réelle avec un ami, et non à un robot attendant une barre de chargement.

Ce que cela signifie (et ce que cela ne signifie pas)

Le document suggère qu'en séparant le « Monde » des « Événements », nous pouvons créer une IA plus flexible. Elle peut être entraînée sur n'importe quel type de vidéo et ensuite spécialisée pour différents travaux, comme un robot naviguant dans une pièce ou un personnage dans un jeu vidéo. Les auteurs montrent que cette approche fonctionne pour leur cas de test spécifique : un personnage numérique qui parle et agit en temps réel.

Cependant, le document précise avec prudence qu'il s'agit d'une démonstration spécifique. Ils ont montré que le modèle peut le faire, et ils ont mesuré la vitesse et la qualité. Ils n'ont pas prétendu avoir résolu tous les problèmes de l'IA, ni listé toutes les utilisations futures possibles. Ils présentent simplement une nouvelle façon de concevoir la génération de vidéo qui rend l'IA plus intelligente quant au fonctionnement du monde, tout en restant assez rapide pour discuter avec vous dès maintenant.

En bref, Wan-Streamer v0.3 est comme donner à un acteur numérique un script qui dit : « Voici la scène, voici votre costume, et voici l'histoire. Maintenant, allez jouer, parler et bouger, et faites-le avant même que je puisse cligner des yeux. » Et grâce à ce nouveau tour du « Monde + Événement », il semble faire exactement cela.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →