← Derniers articles
💻 computer science

GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model

GaussVLA est un modèle Vision-Langage-Action basé sur Mamba et efficace en termes de paramètres qui améliore le raisonnement spatial en introduisant un Tokeniseur Spatial Gaussien pour convertir les caractéristiques 2D en jetons gausiens 3D compacts et un module de Chaîne de Pensée Sensible à la Profondeur pour un raisonnement géométrique structuré, atteignant des performances de pointe sur le benchmark LIBERO avec seulement 200 millions de paramètres.

Auteurs originaux : Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn

Publié 2026-08-27
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots capables d'apprendre à manipuler des objets en observant des humains sont devenus un objectif central de l'intelligence artificielle moderne. Pendant des années, les chercheurs se sont appuyés sur des modèles qui traitent la vue d'une caméra sur le monde comme une grille plate de carrés colorés, semblable à une photographie numérique. Ces modèles sont excellents pour reconnaître quels objets sont présents et comprendre des commandes linguistiques, mais ils peinent à comprendre la forme physique et la position de ces objets dans un espace tridimensionnel. Ils voient une tasse comme un motif de pixels, et non comme un objet solide posé sur une table avec une hauteur et une orientation spécifiques. Cette limitation rend difficile l'exécution par les robots de tâches qui nécessitent une manipulation précise, comme ramasser un objet fragile ou naviguer dans un espace de travail encombré, car le robot manque d'un véritable sens de la géométrie.

Pour combler cette lacune, une équipe de chercheurs a développé un nouveau système appelé GaussVLA, conçu pour donner aux robots une compréhension plus intuitive du monde physique. Au lieu de s'appuyer sur des images plates, ce système convertit les données visuelles en une collection de petites formes tridimensionnelles qui flottent dans l'espace, chacune portant des informations sur l'emplacement d'un objet, sa taille et le degré de confiance du robot concernant cette information. En combinant cette compréhension géométrique avec une nouvelle façon de « réfléchir » aux problèmes spatiaux avant de bouger, les chercheurs ont créé un contrôleur de robot qui est à la fois hautement précis et étonnamment petit. Lors de tests, ce système a surpassé des modèles beaucoup plus grands et complexes, suggérant que donner à un robot un meilleur sens de l'espace est plus important que de simplement agrandir son cerveau.

Le cœur du problème réside dans la manière dont les robots « voient » actuellement. Les systèmes traditionnels décomposent une image de caméra en une longue liste de segments plats, traitant chaque partie de l'image comme étant d'égale importance, qu'il s'agisse d'un mur lointain ou d'un outil juste devant le robot. Bien que cela fonctionne pour des tâches simples, cela échoue lorsque le robot doit juger des distances ou l'angle d'une surface. D'autres tentatives pour corriger cela ont consisté à ajouter des cartes de profondeur, qui sont essentiellement des nombres uniques indiquant au robot à quelle distance se trouve chaque pixel. Cependant, ces cartes de profondeur manquent souvent d'informations sur l'orientation de la surface ou sur la fiabilité de cette mesure de distance, laissant le robot dans l'incertitude lorsque l'environnement change.

Les chercheurs ont abordé ce problème en introduisant une nouvelle façon de traiter les données visuelles appelée le Gaussian Spatial Tokenizer. Imaginez que vous preniez l'image plate et que vous souleviez chaque segment dans les airs, le transformant en un petit nuage 3D flou. Chacun de ces nuages possède un point central, une taille et une forme qui décrivent la géométrie locale de l'objet qu'il représente. Crucialement, le système attribue également un score de confiance à chaque nuage, indiquant au robot son degré de certitude concernant ce morceau du monde en 3D. Cela permet au robot de se concentrer sur les parties les plus fiables de la scène, comme le bord d'une table ou la poignée d'une tasse, tout en ignorant les zones incertaines. Cette transformation transforme une image plate en une carte tridimensionnelle structurée sur laquelle le robot peut raisonner.

Une fois que le robot possède cette carte 3D, il doit encore décider de ce qu'il va faire. Les systèmes précédents tentaient souvent de définir un plan en générant une longue liste de pensées textuelles avant de bouger, un processus lent et souvent déconnecté de l'action physique réelle. Le nouveau système utilise une approche différente appelée Depth-Aware Chain-of-Thought. Au lieu d'écrire une longue histoire, le robot utilise un petit ensemble de questions ciblées pour scanner rapidement sa carte 3D et extraire les relations spatiales les plus importantes nécessaires à la tâche. Il se demande, par exemple, où se trouve l'objet cible par rapport à la main du robot, et utilise cette réponse pour guider directement son mouvement. Cette méthode n'est pas une génération de texte lente et étape par étape, mais un processus de raisonnement rapide et structuré qui se déroule en synchronisation avec la décision de mouvement du robot.

L'ensemble du système est construit sur une architecture de base connue sous le nom de Mamba, conçue pour traiter l'information beaucoup plus rapidement et plus efficacement que les modèles standards utilisés dans la plupart des intelligences artificielles actuelles. Cette efficacité est vitale car elle permet au robot de prendre des décisions en temps réel sans avoir besoin d'un ordinateur massif. Les chercheurs ont testé leur système sur une variété de tâches simulées, incluant le déplacement d'objets, l'empilement de blocs et le suivi d'instructions complexes. Lors de ces tests, le nouveau système a atteint un taux de réussite de 93,5 % sur un benchmark standard, surpassant d'autres modèles de pointe nettement plus grands. Sur un ensemble spécifique de tâches conçues pour tester le raisonnement spatial, il a obtenu un score parfait de 100 %.

Ce qui rend ces résultats particulièrement frappants est la taille du système. Alors que de nombreux modèles concurrents nécessitent des milliards de paramètres pour fonctionner, ce nouveau système fonctionne avec seulement 200 millions de paramètres. Cela signifie qu'il est environ 97 % plus petit que certains des plus grands modèles actuellement en usage, tout en étant plus performant sur les tâches exigeant une compréhension de l'espace physique. Les chercheurs ont également testé le système sur un véritable bras robotique dans un laboratoire physique. Même face à des défis du monde réel comme le bruit de la caméra et des placements d'objets légèrement différents, le système a maintenu un haut niveau de réussite, prouvant que la compréhension géométrique 3D apprise en simulation pouvait se transférer au monde réel.

L'étude a également exploré ce qui se passe lorsque le système est confronté à des changements inattendus, tels que des variations de luminosité ou de couleurs d'objets. Bien que le système ait fait preuve d'une forte robustesse, les chercheurs ont noté qu'il éprouve encore des difficultés lorsque l'environnement change radicalement, indiquant qu'il reste du travail à accomplir pour rendre les robots adaptables à tous les scénarios possibles du monde réel. Cependant, les résultats démontrent clairement que la clé d'une meilleure manipulation robotique ne réside pas seulement dans l'obtention de plus de données ou d'un modèle plus large, mais plutôt dans le fait de donner au robot une compréhension tridimensionnelle structurée de l'espace qu'il occupe. En transformant les images plates en nuages 3D et en utilisant un raisonnement ciblé pour les parcourir, les chercheurs ont montré une voie claire vers des robots capables de manipuler le monde physique avec une plus grande dextérité et fiabilité.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →