← Derniers articles
💻 computer science

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

Cet article introduit Space Tokens, un cadre léger et indépendant de la modalité qui améliore les capacités de raisonnement spatial des modèles de vision-langage en distillant la géométrie 3D et les attributs d'objets en jetons latents continus pour le traitement par chaîne de pensée, atteignant des performances de pointe sur les benchmarks spatiaux sans nécessuer de modules supplémentaires lors de l'inférence.

Auteurs originaux : Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

Publié 2026-08-12
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot à naviguer dans un salon en désordre. Vous lui montrez une image d'un canapé, d'une table basse et d'un chat. Un robot basique pourrait dire : « Je vois un canapé. » Mais pour pouvoir ramasser un jouet sans renverser la table, le robot doit en savoir beaucoup plus : Quelle est la taille du canapé ? À quelle distance se trouve-t-il du mur ? Le chat est-il assis sur la table ou en dessous ? C'est la différence entre simplement voir et réellement comprendre l'espace. Dans le monde de l'intelligence artificielle, on appelle cela l'« intelligence spatiale ». Pendant longtemps, les ordinateurs étaient excellents pour reconnaître des objets mais médiocres pour comprendre comment ces objets s'assemblent dans un espace en 3D. Pour corriger cela, les scientifiques ont essayé deux approches principales : soit rendre le cerveau de l'ordinateur (le modèle) énorme et coûteux, soit ajouter des outils spéciaux et robustes pour mesurer les distances. Les deux fonctionnent, mais ils sont lents et encombrants.

Maintenant, une équipe de chercheurs a trouvé une nouvelle astuce ingénieuse appelée « Space Tokens » (Jetons Spatiaux). Pensez à un modèle d'IA standard comme un étudiant passant un examen. Habitéralement, si l'étudiant doit savoir mesurer une pièce, il doit apporter un rapporteur et un ruban à mesurer (des outils supplémentaires) ou mémoriser une encyclopédie massive de géométrie (un cerveau énorme). Cette nouvelle publication suggère une approche différente : et si l'étudiant pouvait simplement penser en mesures ? Les chercheurs ont trouvé un moyen d'apprendre à l'IA à créer des « notes mentales invisibles » à l'intérieur de son propre processus de réflexion. Ces notes, ou « jetons », agissent comme de minuscules murmures continus de géométrie que l'IA peut utiliser pour raisonner sur la taille, la distance et la forme sans avoir besoin d'outils supplémentaires ou d'un cerveau plus gros. C'est comme donner à l'IA un sens de l'espace intégré qu'elle peut utiliser tout en parlant, ce qui la rend plus intelligente vis-à-vis du monde physique sans la ralentir.

Le Problème : Gros Cerveaux vs Outils Lourds

Imaginez que vous avez un ami très intelligent qui est excellent pour décrire des images. Vous lui montrez une photo d'une cuisine, et il peut vous dire : « C'est un frigo, et c'est un grille-pain. » Mais si vous lui demandez : « Puis-je faire passer une boîte de pizza géante entre le frigo et le grille-pain ? », il pourrait se tromper car il ne « ressent » pas vraiment l'espace.

Pour corriger cela, les scientifiques ont essayé deux voies principales. La première est le « scaling » (mise à l'échelle), ce qui revient à dire à l'ami d'aller lire tous les livres de la bibliothèque et de mémoriser chaque disposition de pièce possible. Cela fonctionne, mais cela nécessite un cerveau massif qui met un temps infini à fonctionner. La seconde voie est celle des « outils spécialisés », ce qui revient à donner à l'ami un télémètre laser et un scanner 3D pour l'utiliser chaque fois qu'il regarde une image. C'est précis, mais c'est lent, coûteux, et l'ami ne peut pas l'utiliser s'il est pressé ou si les outils ne sont pas disponibles.

Les auteurs de cet article ont posé une question simple : Pouvons-nous apprendre à l'ami à simplement « connaître » l'espace dans sa tête, sans avoir besoin de la bibliothèque ou du télémètre laser ?

La Solution : Les Space Tokens

Les chercheurs ont introduit une méthode appelée Space Tokens. Au lieu d'ajouter du matériel ou de rendre le modèle d'IA énorme, ils ont appris à l'IA à générer des « tokens » spéciaux (qui sont juste de petits morceaux de données) représentant l'espace 3D.

Pensez à ces jetons comme des notes autocollantes invisibles que l'IA colle sur ses propres pensées.

  1. Notes au niveau de la scène : Certaines notes décrivent toute la pièce. Elles capturent la forme du sol, la position des murs et la profondeur de la pièce.
  2. Notes au niveau de l'objet : D'autres notes décrivent des articles spécifiques. Elles détiennent des informations sur l'endroit où se trouve un objet, sa taille et son orientation.

La magie réside dans le fait que ces notes sont « continues », ce qui signifie qu'elles ne sont pas de simples étiquettes comme « grand » ou « petit ». Elles sont comme des coordonnées et des mesures précises que l'IA peut utiliser pour faire des mathématiques dans sa tête. L'IA apprend à créer ces notes en observant des exemples provenant d'un modèle « enseignant » (un système de reconstruction 3D très intelligent) puis en s'entraînant jusqu'à pouvoir le faire seule.

Comment ils ont enseigné à l'IA

L'entraînement s'est déroulé en trois étapes, comme un jeu vidéo avec trois niveaux :

  • Niveau 1 : Apprendre le langage de l'espace. L'IA a reçu des images et on lui a appris à générer les « notes autocollantes » (jetons) qui correspondent à la géométrie 3D de la scène. Elle a appris à aligner ses pensées internes avec les formes 3D précises du monde.
  • Niveau 2 : Penser avec les notes. Une fois que l'IA savait comment créer les notes, on lui a appris à les utiliser pour répondre à des questions. On l'a forcée à regarder les notes et à dire : « Parce que le frigo est à 2 mètres, la boîte de pizza ne passera pas. » C'est le raisonnement par « Chaîne de Pensée » (Chain-of-Thought), mais cette fois, les pensées incluent des données spatiales.
  • Niveau 3 : S'améliorer avec la pratique. Enfin, ils ont utilisé une technique d'Apprentissage par Renforcement. L'IA essayait de répondre à des questions, et si elle réussissait à trouver la bonne taille ou la bonne distance, elle recevait une « récompense ». Si elle se trompait, elle apprenait de son erreur. Cela a permis à l'IA d'être encore plus affûtée dans l'utilisation de ses notes spatiales.

Ce qu'ils ont découvert

Les résultats ont été impressionnants. Les chercheurs ont testé leur nouvelle méthode sur un benchmark appelé VSI-Bench, qui est un test difficile pour la compréhension spatiale.

  • Lorsqu'ils ont appliqué cela à un modèle appelé Qwen3-VL-8B, le score a augmenté de 4,3 %.
  • Lorsqu'ils ont appliqué cela à un modèle plus puissant appelé SenseNova-SI-1.3, le score a augmenté de 1,3 %.

Mais la véritable victoire réside dans des tâches spécifiques. La nouvelle méthode est devenue la meilleure au monde pour deviner la taille des objets (réussissant 79,2 % du temps) et la taille des pièces (réussissant 75,7 % du temps). Ce sont des tâches qui nécessitent habituellement des outils 3D lourds, mais cette méthode l'a fait simplement grâce à ses « notes autocollantes » internes.

Pourquoi cela importe

La partie la plus excitante est que l'IA n'a pas eu besoin de changer son cerveau ni de transporter des outils supplémentaires. Elle a juste appris à penser différemment. Les chercheurs ont également montré que ces « notes autocollantes » sont réelles. Ils ont pu décoder ces jetons pour les transformer à nouveau en formes 3D et ont constaté que l'IA avait réellement appris la géométrie de la pièce. Elle ne faisait pas que deviner ; elle avait une véritable compréhension de l'espace.

Cela suggère que nous n'avons pas besoin de construire des modèles d'IA plus grands, plus lents ou plus coûteux pour les rendre spatialement intelligents. Nous devons simplement leur apprendre comment créer et utiliser ces notes spatiales internes. C'est une façon plus légère, plus rapide et plus flexible de donner aux machines la capacité de naviguer dans notre monde 3D, ce qui est une étape majeure pour des choses comme les robots qui doivent se déplacer dans nos maisons ou les voitures qui doivent conduire en toute sécurité.

En résumé, l'article montre qu'en donnant à l'IA un moyen de « penser en 3D » via de simples jetons internes, nous pouvons la rendre bien meilleure pour comprendre le monde physique sans la rendre plus lourde ou plus lente. C'est un petit changement dans la façon dont l'IA pense qui conduit à un grand bond dans ce qu'elle est capable de faire.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →