← Derniers articles
💻 computer science

LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning

Le document introduit LaViT, un cadre qui comble l'écart de perception dans la distillation multimodale en alignant les pensées visuelles latentes et les trajectoires d'attention plutôt que des plongements statiques, permettant ainsi aux modèles compacts d'atteindre une performance de raisonnement visuel supérieure qui rivalise avec des systèmes propriétaires plus vastes.

Auteurs originaux : Linquan Wu, Tianxiang Jiang, Yifei Dong, Haoyu Yang, Fengji Zhang, Shichaang Meng, Ai Xuan, Linqi Song, Jacky Keung

Publié 2026-08-12
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Linquan Wu, Tianxiang Jiang, Yifei Dong, Haoyu Yang, Fengji Zhang, Shichaang Meng, Ai Xuan, Linqi Song, Jacky Keung

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot comment résoudre un mystère. Dans le monde de l'intelligence artificielle, il existe un type spécial de robot appelé Modèle de Langage Large Multimodal (MLLM). Voyez-les comme des détectives super intelligents capables de lire des indices (texte) et d'examiner des photos de scènes de crime (images) en même temps. Pendant longtemps, ces robots étaient doués pour décrire ce qu'ils voyaient, mais lorsqu'il s'agissait de raisonner — de comprendre pourquoi quelque chose s'est produit ou de résoudre une énigme complexe — ils restaient souvent bloqués. Ils regardaient l'image, puis arrêtaient de regarder, et se contentaient de deviner la réponse en fonction de ce qu'ils avaient appris dans les livres. C'est comme un détective qui voit une empreinte de pas boueuse, mais qui ignore ensuite l'indice pour deviner le coupable en se basant sur une intuition.

Récemment, des scientifiques ont découvert un nouveau tour de passe-passe appelé « raisonnement latent ». Au lieu d'écrire chaque étape de leur réflexion en mots (comme un long journal intime), ces robots ont commencé à compresser leurs pensées en « murmures » invisibles et continus à l'intérieur de leur cerveau. C'est plus rapide et plus efficace. Mais il y a un piège : lorsque des scientifiques ont essayé d'apprendre à des robots plus petits et moins coûteux à apprendre des plus grands et plus intelligents (un processus appelé « distillation »), quelque chose d'étrange s'est produit. Les petits robots apprenaient à dire les bons mots, mais ils ne regardaient pas réellement les bonnes parties de l'image. Ils imitaient simplement la voix de l'enseignant sans comprendre les indices visuels. C'est comme un élève qui réussit un examen en mémorisant le corrigé, mais qui échoue à comprendre la leçon.


Le bug du « Voir sans regarder »

Les chercheurs derrière LaViT ont remarqué un phénomène étrange qu'ils appellent le Perception Gap (l'écart de perception). Imaginez que vous avez un chef étoilé (le modèle « Enseignant ») et un jeune apprenti (le modèle « Élève »). L'apprenti regarde le chef cuisiner un plat complexe. Si vous demandez simplement à l'apprenti de noter la recette, il pourrait écrire les mots parfaitement : « Ajoutez deux tasses de farine, fouettez pendant trois minutes. » Mais si vous lui demandez de le faire réellement, il pourrait verser la farine par terre parce qu'il n'a jamais vraiment regardé les mains du chef ; il a simplement mémorisé le texte.

Dans le monde de l'IA, les chercheurs ont découvert que lorsqu'ils entraînaient de petits modèles à copier les réponses de grands modèles, ces petits modèles devenaient excellents dans le « mimétisme textuel ». Ils pouvaient produire la bonne réponse, comme « Le point A est plus proche », mais leur « œil » interne (l'attention visuelle) regardait des parties totalement différentes et non pertinentes de l'image. Ils s'appuyaient sur des astuces linguistiques — deviner en fonction de phrases courantes — plutôt que d'observer réellement les preuves visuelles. C'est comme un étudiant qui réussit un test en mémorisant le corrigé, mais qui ne comprend pas la leçon.

La solution : LaViT (Latent Visual Thoughts)

Pour corriger cela, l'équipe a créé LaViT, un nouveau cadre d'entraînement qui force le robot élève à « penser » visuellement avant de parler. Au lieu de simplement copier la réponse finale, LaViT oblige l'élève à générer d'abord une série de « jetons de pensée » (thought tokens) invisibles. Considérez ces jetons comme un croquis mental ou un monologue interne silencieux où le robot se dit : « D'accord, je dois regarder les ombres ici, et l'angle là, avant de décider quel point est le plus proche. »

La magie de LaViT réside dans deux astuces principales :

  1. Aligner l'« Œil Intérieur » : Le système ne vérifie pas seulement si la réponse finale de l'élève correspond à celle de l'enseignant. Il vérifie son « regard ». Il force l'élève à reconstruire la carte d'attention visuelle de l'enseignant — le chemin spécifique que les yeux de l'enseignant ont parcouru sur l'image. Si l'enseignant a regardé l'ombre pour déterminer la profondeur, l'élève doit regarder l'ombre aussi, même s'il n'a pas encore prononcé un mot.
  2. Le Curriculum de « Gating Sensoriel » : C'est la partie la plus ludique. Imaginez que vous appreniez à quelqu'un à faire du vélo. Si vous le laissez voir la route immédiatement, il risque de se laisser porter et de ne jamais apprendre l'équilibre. Si vous lui mettez un bandeau sur les yeux, il va s'écraser. LaViT utilise un mécanisme de « Curriculum Sensory Gating » (filtrage sensoriel progressif). Au début de l'entraînement, il bloque partiellement la vue directe de l'image pour l'élève. Cela le force à compter entièrement sur ces « jetons de pensée » invisibles pour comprendre les choses. À mesure que l'élève s'améliore, le « bandeau » est progressivement levé, lui permettant de voir l'image à nouveau, mais il a désormais appris à traiter les indices visuels en interne. Cela empêche le robot de prendre la « facilité » en se contentant de deviner grâce au texte.

Ce qu'ils ont découvert

Les résultats ont été étonnamment puissants. Les chercheurs ont testé leur nouveau modèle de 3 milliards de paramètres (qui est relativement petit et compact) contre des modèles beaucoup plus grands et même contre certains des modèles propriétaires les plus avancés disponibles.

  • Le « Petit Géant » : Leur minuscule modèle de 3B, entraîné avec LaViT, a surpassé des modèles de 7B plus grands et a même battu le célèbre GPT-4o sur plusieurs tâches de raisonnement visuel complexes. Par exemple, sur une tâche appelée « Profondeur Relative » (déterminer quel objet est le plus proche), LaViT a obtenu un score de 78,23 %, tandis que GPT-4o a obtenu 64,52 %.
  • Corriger les hallucinations : L'étude a montré que sans cette méthode, les modèles font souvent des « hallucinations » (inventent des choses) lorsqu'ils ne regardent pas assez attentivement. LaViT a considérablement réduit ce phénomène, améliorant les performances sur les tests de perception fine jusqu'à +16,94 %.
  • Stabilité : Les chercheurs ont également constaté que LaViT ne se contentait pas de copier l'enseignant ; il est devenu plus stable. Alors que le modèle enseignant géant avait parfois un regard « vacillant » (regardant des endroits légèrement différents pour des images similaires), l'élève LaViT a appris à se concentrer avec une précision chirurgicale, ignorant le bruit de fond pour se focaliser sur les détails critiques.

Pourquoi c'est important

Cette publication suggère que le secret pour rendre l'IA plus intelligente n'est pas seulement de rendre les modèles plus grands ou de les nourrir avec plus de données. Il s'agit de leur apprendre comment regarder. En forçant l'IA à aligner ses « pensées visuelles » internes avec ses mots finaux, LaViT crée un modèle qui comprend véritablement ce qu'il voit, plutôt que de simplement deviner ce qu'il devrait dire. C'est la différence entre un robot qui mémorise une carte et un robot qui apprend réellement à naviguer sur le terrain. Les auteurs proposent que cette approche pourrait être un moyen plus efficace de construire une IA puissante, prouvant qu'un cerveau plus petit, mais bien entraîné, peut souvent surpasser un cerveau plus grand, mais distrait.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →