← Derniers articles
💻 computer science

ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding

ObjectStream est un cadre de travail sans entraînement qui améliore la compréhension de vidéos en flux continu en organisant les représentations de Video-LLM gelées en ancres d'objets latentes persistantes, permettant un raisonnement efficace et performant sur l'historique et les interactions des objets tout en réduisant considérablement l'utilisation de la mémoire et le nombre de jetons.

Auteurs originaux : Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu

Publié 2026-07-31
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardez le flux en direct d'une rue citadine animée. Des voitures passent en trombe, des gens traversent la route, et un oiseau se pose sur un lampadaire. Maintenant, imaginez que vous êtes un robot essayant de répondre à des questions sur cette rue, mais que vous ne pouvez vous souvenir que d'une infime tranche de ce que vous voyez à un instant donné. Si quelqu'un demande : « De quelle couleur était la voiture qui est passée il y a dix minutes ? » ou « Est-ce que cette personne a fait tomber ses clés ? », votre mémoire pourrait être un mur blanc. C'est le défi de la compréhension vidéo en streaming. C'est une branche de l'intelligence artificielle où les ordinateurs tentent de donner du sens à une vidéo qui arrive en temps réel, comme un flux en direct, plutôt qu'à un film qu'ils peuvent mettre en pause et rembobiner. Le gros problème est que la vidéo est énorme ; c'est un déluge de données visuelles. Si un ordinateur essaie de sauvegarder chaque image, il tombe à court de mémoire (son espace cérébral) et devient trop lent pour répondre aux questions rapidement. Ainsi, les scientifiques doivent trouver comment jeter les parties ennuyeuses (comme un ciel vide) et garder les parties importantes (comme un chien en mouvement) sans perdre l'histoire.

Entrez en scène ObjectStream, une nouvelle méthode qui agit comme un bibliothécaire super organisé pour la mémoire d'un robot. Au lieu d'essayer de se souvenir de chaque pixel de la vidéo, ObjectStream décide de se souvenir des objets comme étant les personnages principaux de l'histoire. Pensez-y de cette façon : si vous décriviez une fête chaotique à un ami, vous ne listeriez pas chaque personne qui est entrée par la porte. Au lieu de cela, vous suivriez les « acteurs clés » : le DJ, la personne qui danse sur la table, le gars au chapeau rouge. ObjectStream fait exactement cela pour les robots. Il regarde les données vidéo figées et dit : « Hé, ce groupe de pixels ressemble à une tasse », puis il tient un journal de bord de cette tasse. Il suit où va la tasse, si elle est renversée, ou si elle disparaît. Il n'a pas besoin d'embaucher une équipe d'experts distincte (comme des détecteurs d'objets externes) pour trouver ces éléments ; il le comprend par lui-même en utilisant le cerveau existant du robot.

L'article présente un système ingénieux en trois parties pour gérer cette mémoire. Premièrement, il crée des « Ancres d'Objets Latents » (Latent Object Anchors). Imaginez que ce sont des post-it que vous collez sur les choses importantes de la vidéo. À mesure que la vidéo défile, le robot met à jour ces notes : « Le mug orange est maintenant sur la table », ou « La tasse bleue est tenue à la main ». Il garde un historique de ces objets, même s'ils se déplacent ou changent légèrement. Deuxièmement, il possède une section spéciale pour les « Changements Transitoires » (Transient Changes). Parfois, des choses se produisent rapidement — un couteau coupe un concombre, ou une balle rebondit. Ce sont des moments rapides qui pourraient être lissés si l'on ne regardait que l'historique à long terme. ObjectStream conserve un « instantané » de ces changements rapides afin que le robot ne manque pas l'action. Troisièmement, il conserve une « Fenêtre de Localisation Visuelle Récente » (Recent Visual Grounding Window), qui est simplement une vue claire et de haute qualité des dernières secondes de vidéo. Cela garantit que si quelqu'un demande : « Que se passe-t-il en ce moment ? », le robot dispose d'une vue fraîche et non floue pour regarder.

Les chercheurs ont testé cette idée sur des modèles d'IA existants qui étaient déjà bons pour comprendre les vidéos mais qui peinaient avec les flux en direct. Ils ont constaté qu'en ajoutant ce système d'« ancres d'objets », les modèles devenaient bien meilleurs pour répondre à des questions sur ce qui se passait dans la vidéo. Par exemple, lors d'un test appelé OVO-Bench, qui vérifie la capacité d'un robot à percevoir les choses en temps réel, le score du modèle a bondi de 10,0 points (passant de 63,3 à 73,3). Plus impressionnant encore, il a fait cela en utilisant environ 50 % de mémoire en moins et en répondant aux questions deux fois plus vite qu'auparavant. En fait, le système était si efficace qu'il pouvait jeter 82,5 % des données vidéo brutes (les « tokens ») et tout en étant plus performant que les modèles qui essayaient de tout garder.

L'article suggère que cette approche est un moyen pratique de résoudre le problème de la mémoire sans avoir besoin de réentraîner l'intégralité du modèle d'IA à partir de zéro. Il montre qu'organiser la mémoire autour d'« choses » (objets) plutôt qu'autour de simples « moments » (images) aide le robot à suivre l'histoire. Les auteurs ont trouvé que cette méthode fonctionne bien aussi bien pour les flux en direct que pour les longues vidéos préenregistrées, prouvant que tenir un journal des objets est une manière intelligente de gérer le déluge d'informations visuelles. Ce n'est pas une solution miracle qui résout tous les problèmes du monde, mais cela suggère que si nous voulons que les robots comprennent notre monde agité et en mouvement en temps réel, nous devons leur apprendre à se souvenir des personnages, et pas seulement du décor.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →