← Derniers articles
💻 computer science

SWIM: Vision-Language-Grounded Soft Whole-Body Interactive Manipulation

SWIM est un cadre de travail ancré dans la vision et le langage qui permet aux robots continus souples d'effectuer des manipulations interactives complexes de tout le corps en intégrant une politique VLA basée sur la diffusion avec une proprioception visuelle souple pour générer des séquences d'action exécutables qui exploitent la compliance intrinsèque pour une exécution physique robuste.

Auteurs originaux : Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

Publié 2026-09-16
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde de la robotique, il existe une distinction nette entre les machines construites avec des cadres métalliques rigides et celles conçues à partir de matériaux souples et flexibles. Les robots rigides, comme les bras que l'on voit dans les usines automobiles, se déplacent avec une certitude précise et préprogrammée, mais ils ont du mal lorsqu'ils doivent se faufiler dans des espaces restreints ou manipuler des objets délicats et irréguliers sans les écraser. Les robots mous, en revanche, sont fabriqués à partir de matériaux compliants qui peuvent se plier, s'étirer et se tordre comme un tissu vivant. Cette flexibilité leur permet de s'enrouler autour d'objets et d'adapter leur forme à leur environnement, offrant une solution potentielle pour les tâches dans des espaces confinés ou pour interagir en toute sécurité avec les humains. Cependant, cette flexibilité même crée un nouveau problème : contrôler un corps capable de se déformer de multiples façons est incroyablement difficile. Lorsqu'un humain donne une commande simple telle que « ramasse ça », un robot rigide peut calculer un chemin unique pour déplacer sa main. Un robot mou, dont tout le corps est capable de changer de forme, doit déterminer comment contorsionner l'ensemble de sa forme pour atteindre le même objectif, une tâche qui nécessite de comprendre non seulement l'objet, mais aussi la géométrie complexe de son propre corps en temps réel.

Des chercheurs ont récemment développé un nouveau système appelé SWIM pour résoudre ce défi spécifique, en apprenant à un robot mou à comprendre le langage et les scènes visuelles pour effectuer une manipulation de tout le corps. L'équipe s'est concentrée sur un robot en forme de spirale actionné par des câbles, de manière similaire à la façon dont les muscles tirent sur les os, ce qui lui permet de s'enrouler, d'atteindre et de s'envelopper autour d'objets. La difficulté principale qu'ils ont abordée était que les méthodes précédentes tentaient souvent de contrôler ces robots en se concentrant uniquement sur l'extrémité du bras, ignorant la forme complexe du reste du corps. Cette approche échouait car la position de l'extrémité ne décrit pas entièrement la façon dont le reste du robot est courbé ou la façon dont il touche le monde. Pour y remédier, les chercheurs ont créé un système d'apprentissage qui observe simultanément la forme de tout le corps du robot, la scène visuelle et une instruction vocale. Ils ont entraîné ce système dans un environnement simulé où le robot pouvait s'exercer des milliers de fois, apprenant à prédire une séquence de mouvements de câbles qui atteindraient un objectif, tel que ranger un objet, atteindre une cible ou le saisir.

Une innovation clé de leur méthode est une technique qu'ils appellent « proprioception visuelle molle ». En termes simples, cela signifie que le robot apprend à « voir » sa propre forme corporelle à partir d'une image de caméra, complétant ainsi sa connaissance interne de la tension des câbles. Pendant l'entraînement, le système utilisait le vecteur de longueur de tendon actuel comme entrée proprioceptive pour comprendre sa configuration, tout en lui montant les coordonnées exactes de plusieurs points le long du corps du robot dans la simulation. En forçant le modèle informatique à prédire où se trouvaient ces points, le système a appris à conserver une carte mentale de la géométrie du robot. Cela lui a permis de comprendre que pour atteindre un objet spécifique, le robot pourrait avoir besoin de courber sa section médiane différemment de ce qu'il ferait pour ranger quelque de chose. De plus, au lieu d'essayer de prédire un chemin unique et parfait vers un objectif, le système a appris à prédire une gamme de mouvements réussis possibles. Ceci est crucial car, avec un corps mou, il existe souvent de nombreuses façons différentes de s'enrouler autour d'un objet, et le système devait être assez flexible pour choisir n'importe quelle option valide plutôt que de rester bloqué sur un plan rigide.

Les chercheurs ont testé cette approche de deux manières : d'abord dans une simulation informatique, puis sur le robot physique réel. Dans la simulation, le système a été remarquablement efficace, accomplissant les tâches de rangement 100 % du temps, atteignant des cibles 96 % du temps et saisissant des objets 88 % du temps. Ces résultats étaient nettement meilleurs que ceux des autres méthodes qui n'utilisaient pas la conscience de la forme du corps ou le modèle de prédiction flexible. Cependant, le véritable test est venu lorsqu'ils ont transféré le système sur la machine physique réelle. Lorsqu'ils ont tenté de faire fonctionner le cerveau du robot directement sur la machine physique, en le connectant à la caméra et aux moteurs en temps réel, les performances ont chuté brutalement. Le robot a échoué à saisir des objets dans 75 % des tentatives, principalement parce que les légers délais de traitement et les différences entre la simulation et la réalité ont fait que le robot agissait sur la base d'informations obsolètes.

Pour surmonter cela, les chercheurs ont introduit une stratégie de déploiement ingénieuse. Au lieu de demander au robot de réfléchir et de réagir en temps réel pendant qu'il se déplace, ils lui font planifier toute la séquence de mouvements dans une simulation virtuelle d'abord. Le robot observe le monde réel, crée un jumeau numérique de la scène, puis exécute la tâche dans son esprit, générant une liste complète de commandes. Une fois que cette séquence complète est prête, le robot l'exécute sans s'arrêter pour regarder ou réfléchir à nouveau. Parce que le corps du robot est naturellement mou et flexible, il peut gérer les petits chocs et les variations de contact de son propre chef sans avoir besoin d'une correction informatique constante. Lorsqu'ils ont utilisé cette méthode « planifier puis exécuter », le taux de réussite du robot physique est remonté en flèche à 100 % pour le rangement, 80 % pour l'atteinte de cible et 75 % pour la saisie. Cela a démontré qu'en combinant une compréhension profonde de la propre forme du robot avec une stratégie qui tire parti de sa flexibilité physique naturelle, les robots mous peuvent être guidés par un langage simple pour accomplir des tâches complexes de manipulation de tout le corps qui étaient auparavant hors de portée.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →