Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation
Le document présente Aero Realtime, un modèle multimodal de streaming de 4B qui parvient à une interaction d'entrée-sortie duplex entièrement alignée sur une grille temporelle partagée, permettant une génération proactive à faible latence avec une réutilisation efficace du cache KV et un délai de traitement inférieur à 200 ms.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'avoir une conversation avec un ami qui regarde aussi un film avec vous. Dans une discussion normale, vous attendez qu'il finisse sa phrase avant de parler. Mais dans une conversation véritablement naturelle, vous pourriez l'interrompre avec un rapide « Wow ! » alors qu'il est encore en train de parler, ou bien vous pourriez rester silencieux pendant qu'il explique un point complexe de l'intrigue, pour ensuite intervenir à la seconde exacte où vous comprenez quelque chose de nouveau. C'est le saint Graal de l'interaction « en temps réel » : la capacité d'écouter et de parler en même temps sans perdre le rythme.
Pendant longtemps, les ordinateurs ont été très mauvais pour cela. La plupart des modèles d'IA fonctionnent comme un jeu de « patate chaude » très poli, mais légèrement lent. Ils attendent que vous terminiez toute votre histoire (l'entrée), la traitent d'un seul coup, puis commencent à parler (la sortie). Ils ne peuvent pas vraiment « écouter » pendant qu'ils « parlent ». Si vous essayez de leur fournir de nouvelles informations pendant qu'ils sont au milieu d'une phrase, ils se confondent ou doivent s'arrêter et recommencer. Cet article s'attaque au problème de la construction d'une IA qui puisse être véritablement « duplex » — capable d'entendre de nouvelles choses et de dire de nouvelles choses simultanément, tout comme un humain le fait, tout en suivant le rythme d'un flux vidéo rapide.
Les chercheurs derrière cet article, de l'Université de Hong Kong et d'autres institutions, ont construit un nouveau modèle d'IA appelé Aero Realtime. Voyez cela comme un modèle qui ne parle pas seulement en phrases, mais en de minuscules « battements » rythmiques de temps. Au lieu d'attendre qu'une vidéo entière se termine, Aero Realtime décompose le temps en de minuscules segments de 80 millisecondes. Pour chaque segment d'audio entendu, il doit prendre une décision en une fraction de seconde : « Dois-je dire un mot dès maintenant, ou dois-je rester silencieux ? »
C'est un changement majeur par rapport au fonctionnement des autres modèles. Habituellement, une IA doit terminer sa phase de « réflexion » avant de commencer sa phase de « parole ». Aero Realtime fait les deux à la fois. Il aligne la vidéo, l'audio et ses propres mots sur une chronologie unique et partagée. Imaginez un tapis roulant où, toutes les 80 millisecondes, une nouvelle pièce de vidéo et d'audio arrive. À ce moment précis, l'IA décide de déposer un mot sur le tapis ou de déposer un « jeton de silence » (un substitut pour rester silencieux). Cela permet à l'IA de continuer à écouter les nouvelles parties de la vidéo même lorsqu'elle est au milieu de la génération d'une phrase. Elle ne s'arrête jamais pour « rattraper son retard ».
L'article soutient que les tentatives précédentes pour rendre l'IA « proactive » (prête à parler) étaient maladroites. Certains systèmes utilisaient une méthode de « micro-tour », où l'IA se demandait constamment : « Dois-je parler maintenant ? ». C'est comme un conducteur qui s'arrête à chaque intersection pour consulter une carte avant d'avancer. D'autres utilisaient des « portes » ou des interrupteurs externes pour décider quand parler, ce qui complexifiait le système et le ralentissait. Aero Realtime rejette ces méthodes. Au lieu de cela, il apprend le timing naturellement. Le modèle est entraîné pour traiter le « silence » comme un mot valide, tout comme « bonjour » ou « chat ». Cela signifie que l'IA n'a pas besoin d'un interrupteur séparé pour décider quand parler ; la décision de parler ou de rester silencieux est directement intégrée au même processus qui choisit les mots.
Pour faire fonctionner cela, l'équipe a dû résoudre des puzzles d'ingénierie complexes. Ils ont créé une manière spéciale d'entraîner le modèle en utilisant un mélange de données vidéo en temps réel et de questions sur des vidéos standards. Ils ont également conçu une nouvelle façon d'exécuter le modèle sur des ordinateurs qui économise la mémoire et la vitesse. Au lieu de relire toute la vidéo à chaque fois qu'une nouvelle image arrive, le modèle se souvient de ce qu'il a déjà traité et n'ajoute que la nouvelle « tranche » d'information. C'est comme lire un livre où vous n'avez pas besoin de relire le premier chapitre à chaque fois que vous tournez une page ; vous mémorisez simplement où vous vous étiez arrêté et vous continuez.
Les résultats sont impressionnants pour un modèle de sa taille. Les chercheurs ont testé Aero Realtime sur un flux vidéo continu de 20 minutes. Même pendant que la vidéo se déroulait, le modèle a réussi à maintenir son « décalage » — le délai entre ce qui se passe dans la vidéo et ce que l'IA dit — à une médiane de 84 millisecondes. C'est moins qu'un clin d'œil. Même au 95e percentile (ce qui signifie que 95 % du temps), le délai n'était que de 173 millisecondes. Cela signifie que l'IA reste à moins de 200 millisecondes de la chronologie « réelle », écoutant et parlant efficacement en temps réel.
Cependant, l'article prend soin de ne pas prétendre que c'est l'IA la plus performante au monde pour comprendre la vidéo. Lors de tests sur un benchmark standard appelé OVOBench, le modèle de 4 milliards de paramètres (qui est relativement petit) a obtenu un bon score, mais n'a pas battu les modèles les plus grands et les plus puissants de 7 milliards de paramètres, qui sont conçus pour des tâches hors ligne et non en temps réel. Les auteurs suggèrent que cet écart existe parce que le modèle a dû apprendre une toute nouvelle façon d'interagir (le style « duplex ») et qu'il n'avait pas autant de données d'entraînement spécifiques pour ce type exact de conversation en temps réel que les anciens modèles en avaient pour les questions traditionnelles.
En résumé, Aero Realtime prouve qu'il est possible de construire une IA qui ne se contente pas d'attendre son tour pour parler, mais qui peut véritablement converser en temps réel, en écoutant et en parlant simultanément sans sourciller. C'est une étape vers une IA qui ressemble moins à un robot attendant des instructions et plus à un ami qui prête réellement attention au monde avec vous. Bien qu'elle ne soit pas encore l'expert vidéo le plus intelligent de la pièce, c'est la première à maîtriser véritablement l'art de suivre le flux du temps.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.