VGGT-DP: Generalizable Robot Control via Vision Foundation Models
VGGT-DP est un cadre de contrôle robotique généralisable qui améliore les performances des politiques visuomotrices en intégrant des priors géométriques provenant d'un modèle de perception 3D pré-entraîné avec un retour proprioceptif, tout en employant la réutilisation de jetons par trame et l'élagage aléatoire de jetons pour améliorer l'ancrage spatial, la robustesse et l'efficacité de l'inférence.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les robots ont longtemps lutté pour se déplacer avec la confiance fluide d'une créature vivante. Pendant des décennies, les ingénieurs ont programmé des machines avec des règles rigides et écrites à la main, leur dictant exactement comment bouger leurs bras pour chaque situation possible. Cette approche fonctionnait dans des usines contrôlées, mais échouait lamentablement lorsque le monde changeait ne serait-ce qu'un peu. Ces dernières années, une nouvelle approche s'est imposée : enseigner aux robots en leur montrant des exemples, tout comme un enfant apprend en regardant ses parents. Le robot observe un humain accomplir une tâche et tente de copier les mouvements. Cependant, ces systèmes d'apprentissage manquent souvent d'une compréhension profonde de l'espace. Ils peuvent reconnaître un objet, mais échouent fréquemment à saisir comment cet objet se situe dans l'espace tridimensionnel par rapport au propre corps du robot. Ce fossé dans la compréhension spatiale limite la capacité d'un robot à gérer des tâches complexes ou à s'adapter lorsque l'angle de la caméra change ou que l'environnement évolue.
Une équipe de chercheurs a développé un nouveau système conçu pour combler ce fossé, en s'inspirant du fonctionnement de la vision biologique. Dans la nature, les animaux ne dépendent pas d'un seul sens pour naviguer ; ils combinent ce qu'ils voient avec un sens interne constant de la position de leur propre corps, appelé proprioception. Ce feedback interne permet à une mouche de se poser sur une feuille en mouvement ou à un chat de marcher sur un rebord étroit sans tomber. Les chercheurs, dirigés par Shijia Ge et ses collègues de l'Université de Tsingue et d'autres institutions, ont créé un cadre appelé VGGT-DP qui imite cette stratégie biologique. Au lieu de s'appuyer sur des instructions linguistiques ou de simples indices visuels, leur système fusionne un puissant modèle visuel pré-entraîné avec les capteurs d'état interne du robot. Cette combinaison permet au robot de construire une carte tridimensionnelle robuste de son environnement et de comprendre exactement où se trouvent ses propres membres dans cet espace.
Le cœur de ce nouveau système est un moteur visuel entraîné sur de vastes quantités de données de reconstruction 3D. Alors que les modèles de vision robotique standard sont souvent conçus pour être petits et rapides, sacrifiant le détail au profit de la vitesse, ce système utilise un modèle à grande échelle capable de prédire la profondeur, les angles de la caméra et l'emplacement précis de chaque point d'une scène. Les chercheurs ont découvert qu'en utilisant ce modèle visuel de haute puissance, le robot acquérait un sens de la géométrie beaucoup plus fort. Cependant, faire fonctionner un tel modèle en temps réel est coûteux en termes de calcul et lent. Pour résoudre cela, l'équipe a inventé une astuce ingénieuse appelée réutilisation de jetons par trame (frame-wise token reuse). Dans un flux vidéo typique, de nombreuses trames se chevauchent considérablement ; l'arrière-plan et la plupart des objets ne changent pas d'une milliseconde à l'autre. Le nouveau système reconnaît cela et cesse de recalculer les caractéristiques visuelles des parties de l'image qui n'ont pas changé. Il ne traite que les nouvelles informations arrivant dans la dernière trame, réutilisant les données mises en cache des moments précédents. Cette approche a considérablement réduit le temps nécessaire pour que le robot réfléchisse, rendant le puissant modèle visuel pratique pour une utilisation dans le monde réel.
Pour s'assurer que la vision du robot correspondait à sa réalité physique, les chercheurs ont ajouté une couche de supervision interne. Ils ont appris au système visuel à prédire les angles des articulations et la position de la main du robot en se basant uniquement sur ce qu'il voyait. Si les yeux du robot voyaient une main s'approcher d'une tasse, le système devait être capable de deviner correctement où cette main se situait dans l'espace. Cela a forcé le modèle visuel à s'aligner parfaitement avec l'état interne du robot, créant une boucle de rétroaction serrée. La dernière pièce du puzzle impliquait une méthode appelée élagage aléatoire de jetons (random token pruning), où le système ignore intentionnellement de petites parties aléatoires des données visuelles pendant l'entraînement. Cette technique agit comme une forme de test de résistance, forçant le robot à apprendre la forme et la structure globale d'une scène plutôt qu'à mémoriser des détails spécifiques, ce qui le rend plus résilient face aux informations manquantes ou au bruit.
Lorsqu'ils ont été testés sur une série de tâches de manipulation difficiles, telles que ramasser des objets dans des trous, balayer des articles dans un panier ou tirer sur un bâton, le nouveau système a montré des améliorations remarquables par rapport aux méthodes existantes. Dans des scénarios difficiles nécessitant un raisonnement spatial précis, la nouvelle approche a obtenu des taux de réussite nettement plus élevés que les modèles de pointe précédents. Par exemple, dans une tâche nécessitant de ramasser un objet au fond d'un trou profond, le nouveau système a réussi dans 55 % des tentatives, alors que la meilleure méthode précédente (DP3) n'atteignait que 14 %. Le système s'est également révélé très efficace dans des tâches comme le balayage d'articles pour former un tas, où il a réussi 44 % du temps contre seulement 15 % pour le concurrent le plus proche. Ces résultats suggèrent que donner aux robots une compréhension de la géométrie profonde est bien plus critique pour la manipulation complexe que l'ajout de capacités linguistiques.
Cependant, les chercheurs ont pris soin de noter les limites du système. Bien qu'il excellait dans les tâches nécessitant un raisonnement spatial complexe, il n'a pas toujours surpassé les modèles plus anciens et plus simples lors de tâches très basiques, comme atteindre un objet proche. Dans ces scénarios simples, le modèle visuel lourd introduisait parfois une complexité inutile. Plus significativement, le système a éprouvé des difficultés lorsque l'angle de la caméra changeait même légèrement. Lorsque les chercheurs ont testé le robot avec une caméra pivotée de seulement cinq degrés, le taux de réussite a chuté de façon spectaculaire, passant de près de 40 % à presque zéro. Cela indique que, bien que le système ait appris à comprendre l'espace 3D, il n'a pas encore appris à être assez flexible pour gérer des points de vue qui n'étaient pas présents dans ses données d'entraînement. Les chercheurs suggèrent que les travaux futurs doivent se concentrer sur la création de représentations visuelles plus robustes aux changements de perspective.
L'étude conclut que la voie vers des robots plus capables ne réside pas dans le fait de les rendre plus intelligents grâce au langage, mais dans le fait de rendre leur vision plus ancrée dans la réalité physique. En combinant un modèle visuel à grande échelle qui comprend la géométrie 3D avec le sens interne du corps du robot, les chercheurs ont créé un système capable de naviguer et de manipuler le monde avec un niveau de précision inédit dans l'apprentissage par imitation. Ce travail démontre que la clé d'un contrôle robotique généralisable est une compréhension spatiale profonde de l'environnement, soutenue par une conscience interne de l'état du robot. Bien que des défis subsistent, notamment pour gérer les changements inattendus d'angles de caméra, les résultats offrent une direction claire pour l'avenir du contrôle robotique : privilégier l'ancrage spatial et l'inspiration biologique plutôt que la complexité linguistique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.