← Derniers articles
💻 computer science

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

DeltaV est un modèle multimodal large et unifié qui améliore l'efficacité et la performance du raisonnement en remplaçant la génération d'images complètes par un paradigme de mise à jour visuelle compact guidé par un routeur de similitude temporelle, soutenu par un nouveau jeu de données de raisonnement entrelacé à grande échelle appelé StructCoT.

Auteurs originaux : Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

Publié 2026-07-10
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous jouez à une partie complexe de « Simon dit » avec un ami robot, mais qu'au lieu de simplement écouter, vous devez dessiner chaque étape du jeu sur un tableau blanc pour montrer à votre ami ce qui se passe.

L'ancienne méthode : l'artiste trop zélé
Actuellement, la plupart des modèles d'IA avancés qui tentent de résoudre des problèmes avec des images (comme résoudre un labyrinthe ou une énigme mathématique) fonctionnent comme un artiste très méticuleux, mais légèrement inefficace. Disons que le jeu commence par l'image d'une table avec une tasse posée dessus.

  • Étape 1 : L'IA dessine toute la table avec la tasse.
  • Étape 2 : La règle du jeu dit : « Déplace la tasse vers la gauche. » L'IA, cependant, efface l'intégralité du tableau blanc et redessine à nouveau toute la table, y compris la tasse, les pieds de la table, l'arrière-plan et les ombres, juste pour montrer que la tasse a bougé d'un pouce.
  • Étape 3 : « Fais pivoter la tasse. » L'IA efface tout et redessine à nouveau toute la table une fois de plus.

Le texte appelle cela la « génération d'image complète ». Les auteurs soutiennent que c'est un énorme gaspillage d'énergie et d'espace. C'est comme réécrire tout le dictionnaire à chaque fois que vous voulez changer un seul mot dans une phrase. L'IA passe la majeure partie de son temps à redessiner des choses qui n'ont pas changé du tout, ce qui la rend lente et provoque parfois des erreurs de détails (comme changer la couleur de la tasse par accident parce qu'elle a oublié à quoi elle ressemblait auparavant).

La nouvelle méthode : DeltaV, l'artiste des « autocollants »
La méthode introduit un nouveau modèle appelé DeltaV. Au lieu de redessiner toute la scène, DeltaV agit comme un habile artiste d'autocollants.

  • Étape 1 : Il dessine la table avec la tasse (l'« État de base »).
  • Étape 2 : Quand la tasse doit bouger, DeltaV ne redessine pas la table. Il dessine simplement un petit « autocollant » montrant la tasse se déplaçant vers la gauche et le colle sur l'ancien emplacement. Il ignore les pieds de la table et l'arrière-plan car ils n'ont pas changé.
  • Étape 3 : Quand la tasse pivote, il ajoute simplement un petit « autocollant de rotation ».

Cette approche est appelée mises à jour visuelles. Le papier suggère qu'en ne dessinant que les changements (le « Delta »), l'IA économise une quantité massive de travail. Dans leurs tests, cette méthode a réduit le nombre de nouveaux « jetons de dessin » (l'encre numérique utilisée pour créer l'image) de 55,6 % en moyenne, sans pour autant dégrader la qualité des images.

Le bouton « Arrêt » intelligent : le routeur TSIM
Vous pourriez vous demander : « Et si le changement est énorme ? Et si toute la scène explose ? »
DeltaV possède un gestionnaire intelligent intégré appelé le routeur TSIM. Considérez cela comme un superviseur qui regarde à quel point la nouvelle scène est différente de l'ancienne.

  • Si le changement est infime (comme déplacer une tasse), le superviseur dit : « Utilise juste quelques autocollants. »
  • Si le changement est massif (comme si toute la pièce changeait), le superviseur dit : « D'accord, utilise plus d'autocollants pour être sûr de bien faire. »

Le papier a mesuré cela en vérifiant la capacité de l'IA à reconstruire l'image. Ils ont constaté que si l'on continuait à ajouter des jetons au-delà d'un certain point, l'image ne s'améliorait pas beaucoup plus. Ainsi, le routeur TSIM arrête d'ajouter des jetons dès que « l'effort supplémentaire » ne porte plus ses fruits. Cela garantit que l'IA ne perd pas de temps sur des étapes simples, mais qu'elle ne fait pas l'économie de l'effort lors de tâches complexes.

Le terrain d'entraînement : StructCoT
Pour apprendre à DeltaV comment faire cela, les chercheurs ne pouvaient pas simplement utiliser de vieux livres de puzzles. Ils ont construit un nouvel ensemble d'entraînement massif appelé StructCoT.

  • Il contient 1,05 million d'échantillons.
  • Il couvre 44 types différents de tâches, allant des puzzles logiques et des problèmes mathématiques à la planification robotique et aux questions scientifiques.
  • Le papier soutient que les ensembles de données précédents étaient trop petits ou trop focalisés sur des choses spécifiques comme les labyrinthes, tandis que StructCoT offre à l'IA une éducation beaucoup plus large sur la façon dont les états visuels évoluent au fil du temps.

Les résultats : Est-ce que ça a marché ?
Le papier rapporte que lorsqu'ils ont testé DeltaV :

  • Il a résolu des problèmes de raisonnement multimodal 3,3 % mieux que l'ancienne méthode de « tout redessiner ».
  • Même si DeltaV est un modèle plus petit (2 milliards de paramètres), il a battu des modèles open-source beaucoup plus grands de 8,4 % en moyenne sur ces tâches de raisonnement.
  • Il a également surpassé un modèle comparable nommé Qwen3-VL-2B de 5,9 % sur des benchmarks externes.

Ce que le papier écarte
Les auteurs sont très clairs sur ce qui ne fonctionne pas. Ils soutiennent explicitement l'idée qu'il n'est pas nécessaire de générer une image complète et haute résolution à chaque étape du raisonnement. Ils suggèrent que tenter de faire cela crée une « redondance de jetons visuels » (gaspillage d'encre numérique) et nuit réellement à la capacité de raisonnement de l'IA car elle est distraite par le redessin de choses qui n'ont aucune importance. Ils notent également que, bien que cette méthode soit excellente pour le raisonnement, elle pourrait ne pas être la meilleure pour les tâches exigeant des détails extrêmement fins (comme repérer un minuscule grain de poussière), où une image complète pourrait encore être nécessaire.

L'essentiel
Le papier suggère que l'avenir du raisonnement de l'IA n'est pas de redessiner le monde entier encore et encore. Il s'agit plutôt de penser en termes de « qu'est-ce qui a changé ? ». En se concentrant uniquement sur les mises à jour, DeltaV devient plus rapide, plus efficace et étonnamment meilleur pour résoudre des puzzles complexes que ses cousins plus lourds qui dessinent des images complètes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →