← Derniers articles
💻 computer science

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

L'article présente LLaVA-OneVision-2, un modèle vision-langage de nouvelle génération qui atteint des performances de pointe dans les tâches de localisation vidéo, spatiale et temporelle en exploitant une stratégie de tokenisation par flux de codec novatrice, un système de coordonnées 3D RoPE unifié et une supervision ouverte à grande échelle.

Auteurs originaux : Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhan
Publié 2026-05-26
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhang, Chunsheng Wu, Chunjiang Ge, Zimin Ran, Dehua Song, Chunyuan Li, Shikun Feng, Ming Hu, Zhangquan Chen, Junbo Niu, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de décrire un film de 30 minutes à un ami, mais que vous n'avez que le temps de lui montrer 30 images.

La plupart des modèles d'IA actuels (comme ceux qui précèdent ce nouveau modèle) jouent la sécurité : ils sélectionnent 30 images espacées uniformément. Une image par minute. Si quelque chose d'excitant se produit entre la 10e et la 11e minute, l'IA le manque complètement car elle ne regardait pas à cette seconde précise. C'est comme essayer de comprendre un match de football rapide en ne regardant le tableau d'affichage qu'une fois par minute ; vous manqueriez le but.

LLaVA-OneVision-2 est un nouveau type de « super-observateur » qui change les règles. Au lieu de regarder le film comme une série de clichés statiques, il traite la vidéo comme un fichier numérique compressé (le type que votre téléphone utilise pour économiser de l'espace).

Voici comment cela fonctionne, en utilisant des analogies simples :

1. La boussole du « coût en bits »

Lorsque vous compressez une vidéo (comme transformer un film brut en MP4), l'ordinateur doit travailler plus dur pour décrire les parties de la vidéo où les choses bougent vite ou changent radicalement (comme un accident de voiture ou un danseur qui tourne). Il dépense plus d'« énergie numérique » (bits) pour ces parties. Il dépense très peu d'énergie pour les parties ennuyeuses où rien ne se passe (comme un mur statique).

LLaVA-OneVision-2 lit cette « carte d'énergie ».

  • L'ancienne méthode : « Je vais regarder la vidéo pendant 1 seconde, puis sauter 1 seconde, puis regarder à nouveau. »
  • La nouvelle méthode : « Je vois que le fichier vidéo utilise beaucoup d'énergie en ce moment car l'action est intense ! Je vais concentrer mon attention là-dessus. Je vois que l'énergie est faible ici ; je vais sauter cette partie. »

Il concentre son « pouvoir cérébral » (tokens) exactement là où l'action se produit, plutôt que de le répartir uniformément.

2. Le « détective de mouvement »

Le modèle cherche également des « résidus ». Imaginez que vous regardez une vidéo d'une personne qui marche. L'arrière-plan (la pièce) reste le même. Le modèle réalise : « Je n'ai pas besoin de réexpliquer la pièce dans chaque image. » Il ne prête attention qu'aux parties qui ont changé (la personne en mouvement).

Il crée une « toile visuelle » qui est un collage des parties mobiles les plus importantes, assemblées efficacement. Cela lui permet de regarder une vidéo de 15 minutes sans être submergé, car il ignore les parties ennuyeuses et répétitives et zoome sur l'« histoire ».

3. Le test de la « corde à sauter »

Pour prouver que cela fonctionne, les chercheurs ont créé un nouveau test appelé JumpScore. Imaginez une vidéo de quelqu'un sautant à la corde. Il saute de haut en bas des centaines de fois. Pour une IA normale, chaque saut semble exactement identique. Il est difficile de dire quel saut spécifique l'utilisateur demande.

  • L'ancienne IA était confuse et devinait au hasard, obtenant environ 30 sur 100.
  • LLaVA-OneVision-2 a repéré les minuscules moments d'une fraction de seconde où la corde touchait le sol ou où la position des pieds de la personne changeait. Il a obtenu 75 sur 100.

Il n'a pas seulement vu « le saut » ; il a vu le moment exact où le saut s'est produit.

4. Le « navigateur spatial »

Le modèle est également devenu très bon pour comprendre l'espace. Si vous lui demandez : « Montre l'espace vide entre la tasse de café et l'ordinateur portable », il peut le faire avec une grande précision. Il peut même suivre des objets se déplaçant dans une vidéo (comme un chat traversant une pièce) et garder ses yeux dessus sans les perdre de vue, même si le chat est partiellement caché.

La grande image

Les chercheurs n'ont pas simplement construit un cerveau plus grand ; ils ont construit une façon plus intelligente de regarder.

  • Avant : L'IA était comme un touriste prenant une photo toutes les minutes d'une randonnée, espérant ne pas manquer la vue.
  • Maintenant : L'IA est comme un guide qui sait exactement où se trouve la vue, de sorte qu'il ne s'arrête pour prendre une photo que lorsque le paysage change réellement.

Le résultat est un modèle qui comprend les vidéos longues, trouve des moments spécifiques dans l'action rapide et raisonne sur l'espace bien mieux que les modèles précédents, tout en utilisant la même quantité de puissance informatique. Ils ont rendu tout leur code, leurs données et le modèle lui-même disponibles gratuitement pour tout le monde.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →