ReWorld: An Interactive World Model with Long-Horizon Memory
ReWorld est un modèle de monde interactif qui résout la tension structurelle entre le contrôle à court horizon et la mémoire à long horizon en séparant ces capacités lors de l'entraînement grâce à des mécanismes d'attention mixtes et en les unifiant lors de l'inférence via un système de recherche de points de repère indexés par pose, atteignant ainsi une fidélité d'action, une qualité vidéo et une cohérence temporelle de plusieurs minutes supérieures à travers divers domaines visuels.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un ordinateur capable de regarder une vidéo puis de prédire ce qui se passe ensuite, image par image, comme s'il vivait à l'intérieur de la scène. C'est la promesse d'un « modèle de monde » (world model), un type d'intelligence artificielle conçu pour simuler des environnements où un agent peut se déplacer et agir. Pour que ces systèmes semblent véritablement vivants, ils doivent accomplir trois tâches difficiles simultanément : ils doivent réagir instantanément aux commandes d'un utilisateur, ils doivent se souvenir exactement de l'aspect d'un lieu lorsque l'utilisateur l'a quitté et y est revenu, et ils doivent continuer à générer de nouvelles vidéos en temps réel sans manquer de mémoire. Le problème est que ces objectifs s'opposent souvent. Pour réagir rapidement, un système doit se concentrer uniquement sur le passé immédiat, mais pour se souvenir d'un lieu lointain, il doit conserver une histoire vaste. Si un système tente de faire les deux avec la même approche simple, il échoue généralement à l'un ou à l'autre, soit en oubliant le passé, soit en trébuchant sur le présent.
Des chercheurs ont maintenant construit un système appelé ReWorld qui résout cette tension en apprenant à l'ordinateur à penser de deux manières différentes simultanément. L'équipe, travaillant avec des institutions de Hong Kong et d'Alibaba, a créé un modèle capable de suivre les mouvements de caméra d'un utilisateur, de diffuser des vidéos de haute qualité de mondes photoréalistes ou de type jeu vidéo, et de se rappeler des scènes spécifiques d'il y a plusieurs minutes, même après que la caméra s'est éloignée et est revenue. La découverte clé est que le système n'a pas besoin de choisir entre réaction à court terme et mémoire à long terme ; au contraire, il sépare ces tâches pendant son processus d'apprentissage et les gère soigneusement lorsqu'il est en cours d'exécution.
Le succès de ReWorld repose sur la façon dont il organise son attention. Dans de nombreux modèles d'intelligence artificielle, le système examine toutes les informations qu'il a vues jusqu'à présent pour décider de ce qu'il va générer ensuite. ReWorld répartit ce travail entre différentes parties de son cerveau. Certaines parties sont entraînées pour ne regarder que le passé très récent, par exemple les dernières secondes, afin de garantir qu'une pression sur un bouton se traduise par un mouvement de caméra immédiat et précis. D'autres parties sont entraînées pour regarder l'intégralité de l'historique de la vidéo, permettant au système de reconnaître qu'une formation rocheuse ou un bâtiment spécifique vu il y a longtemps est bien le même qu'il voit à nouveau maintenant. Crucialement, les chercheurs n'ont pas assigné ces tâches à des parties fixes du système. Au lieu de cela, ils ont mélangé les rôles de manière aléatoire pendant l'entraînement, garantissant que chaque partie du système apprenne à gérer à la fois les réactions immédiates et les souvenirs lointains. Cela empêche le système de devenir dépendant d'une manière spécifique de regarder le passé, ce qui est vital car, dans le monde réel, le système ne peut pas garder tout son historique en mémoire indéfiniment.
Lorsque le système est mis en action, il est confronté à une limite stricte de la quantité d'informations qu'il peut contenir à un instant donné. Pour gérer cela, ReWorld utilise un système de classement ingénieux. À mesure que la vidéo défile, il conserve une petite fenêtre, constamment mise à jour, des images les plus récentes. Lorsque des images plus anciennes sortent de cette fenêtre, elles ne sont pas simplement supprimées. Au lieu de cela, le système vérifie si la caméra a suffisamment bougé pour justifier la sauvegarde d'un instantané de cet emplacement. Si c'est le cas, le système enregistre un « point de repère » (landmark) de haute qualité de cette scène. Ces points de repère sont stockés dans une banque séparée et limitée. Lorsque la caméra fait demi-tour et retourne vers un endroit visité précédemment, le système recherche dans cette banque le point de repère qui correspond à la vue actuelle et le réintègre dans la mémoire active. Cela permet au système de se souvenir d'une scène d'il y a une minute sans avoir besoin de stocker chaque image survenue entre-temps.
Pour faire fonctionner cela, les chercheurs ont dû enseigner au modèle en utilisant un type de données très spécifique. Ils ont combiné des séquences de vidéos réelles, de jeux vidéo et d'environnements générés par ordinateur, mais ils ont fait une chose inhabituelle : ils se sont assurés qu'une commande unique, comme appuyer sur une touche pour avancer, déplace la caméra exactement de la même distance physique dans chaque type de séquence. Cela a créé un langage de mouvement unifié. Ils ont également utilisé une technique d'entraînement spéciale où ils cachaient parfois des parties de l'historique de la vidéo au modèle, le forçant à apprendre comment reconstruire la scène même lorsque sa mémoire était incomplète. Cela a préparé le modèle à la réalité de sa banque de mémoire limitée, garantissant qu'il ne serait pas confus lorsqu'il devrait s'appuyer sur quelques points de repère clés plutôt que sur un flux continu de données.
Les résultats de cette approche sont frappants. Dans des tests où la caméra s'éloignait puis revenait à son point de départ, ReWorld a été capable de régénérer la vue originale avec une précision remarquable, même après que la caméra a voyagé pendant une minute ou plus. D'autres systèmes, qui reposent sur le maintien d'une simple fenêtre glissante d'images récentes, ont échoué à se souvenir du point de départ une fois que celui-ci est sorti de leur fenêtre. ReWorld s'est également révélé supérieur pour suivre les commandes, la caméra se déplaçant exactement comme prévu sans dériver de sa trajectoire. Le système peut générer de la vidéo à une résolution de 704 par 1280 pixels, assez rapidement pour être interactif, et il maintient cette qualité à travers différents styles, des paysages réalistes aux mondes de jeux stylisés.
Les chercheurs ont constaté que leur méthode fonctionne parce qu'elle respecte les besoins différents du contrôle et de la mémoire. En apprenant au système à gérer séparément les commandes à court terme et le rappel à long terme, et en utilisant un système de récupération intelligent pour ramener les anciens souvenirs seulement quand ils sont nécessaires, ils ont créé un modèle de monde qui semble à la fois réactif et cohérent. Le système n'a pas besoin d'être une entité massive et omnisciente pour se souvenir du passé ; il lui suffit de savoir comment trouver la bonne pièce du passé au moment où elle est nécessaire. Cette approche permet au modèle de fonctionner sur du matériel informatique standard tout en maintenant un sentiment de continuité qui était auparavant impossible pour la génération de vidéo interactive. Ce travail suggère que l'avenir de l'IA interactive ne réside pas seulement dans la création de modèles plus grands, mais dans la capacité de ces modèles à être plus intelligents dans la manière dont ils organisent et accèdent aux informations qu'ils ont déjà apprises.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.