← Derniers articles
🤖 AI

DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

DeCAL est un modèle de vision-langage-action dextre physiquement ancré qui exploite une architecture de mélange de Transformers avec une fusion visuo-tactile adaptative et une co-imagination latente pour atteindre des performances de pointe dans les tâches de manipulation riches en contacts en intégrant dynamiquement la détection tactile et la modélisation de la dynamique physique.

Auteurs originaux : Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

Publié 2026-09-09
📖 9 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots ont longtemps été les maîtres des usines, déplaçant des objets lourds le long de trajectoires prévisibles avec une précision rigide. Pourtant, lorsque nous leur demandons d'entrer dans nos maisons et d'accomplir les tâches délicates et salissantes de la vie quotidienne — visser une ampoule, essuyer un vase ou dévisser un bouchon — ils faiblissent souvent. Le monde n'est pas une grille propre et statique ; c'est un lieu de frictions constantes et subtiles. Pour réussir, une machine doit faire plus que simplement voir ; elle doit sentir. Elle doit comprendre la physique invisible du contact : le moment où un doigt glisse, la pression requise pour tourner un bouton, ou la façon dont un objet mou se déforme sous la pression. Pendant des décennies, les scientifiques ont tenté de combler ce fossé en dotant les robots à la fois d'yeux et de peau, mais apprendre à une machine à combiner ces sens en une intuition fluide et unique est resté l'un des défis les plus tenaces de l'intelligence artificielle.

Une équipe de chercheurs a maintenant franchi une étape significative avec un nouveau système appelé DeCAL. Il ne s'agit pas simplement d'un robot capable de voir et de toucher ; c'est un système conçu pour imaginer le futur d'une interaction physique avant qu'elle ne se produise. En construisant un modèle qui unifie compréhension, imagination et action, les chercheurs ont créé une politique robotique capable de naviguer dans le monde complexe et riche en contacts de la manipulation humaine avec un niveau de dextérité jusque-là inédit. Le système a été testé sur six tâches distinctes, allant de l'essuyage d'un vase à l'assemblage de petites pièces, et il a systématiquement surpassé les méthodes existantes les plus avancées. Lors de ces essais en conditions réelles, DeCAL a atteint un taux de réussite allant jusqu'à 100 % sur les tâches simples et a maintenu un taux de réussite moyen robuste de 71 % sur l'ensemble des six défis, même lorsque l'environnement changeait de manière inattendue.

Le problème central que les chercheurs ont abordé est que la vision seule est souvent aveugle aux moments les plus critiques de la manipulation. Lorsqu'une main robotique s'approche d'un objet, les doigts bloquent souvent la vue de la caméra, créant un « angle mort » exactement au moment où le robot a le plus besoin de savoir. De plus, les données visuelles ne peuvent pas dire à un robot avec quelle force il pousse ou si un objet est sur le point de glisser. Alors que les tentatives précédentes pour ajouter des capteurs tactiles aux robots les traitaient souvent comme de simples ajouts, DeCAL intègre l'information tactile comme une partie fondamentale de son processus de pensée. Le système utilise des capteurs haute résolution sur chaque bout de doigt capables de détecter la forme de la surface d'un objet lorsqu'elle se déforme sous la pression, ainsi que les forces précises appliquées. Cela permet au robot de « ressentir » le monde d'une manière aussi riche et détaillée que ce qu'il voit.

Ce qui rend DeCAL véritablement unique, c'est la façon dont il traite cette information. Au lieu de simplement réagir à ce qu'il voit ou ressent dans l'instant présent, le système est entraîné pour imaginer ce qui va se passer ensuite. Il opère avec trois capacités distinctes mais connectées. Premièrement, il comprend la situation actuelle en observant la scène visuelle, en lisant une instruction linguistique et en ressentant les points de contact. Deuxièmement, il s'engage dans une forme de « co-imagination », où il prédit comment la scène visuelle et les sensations tactiles vont évoluer dans les secondes suivantes. Il se demande essentiellement : « Si je tourne le bouchon maintenant, comment la force va-t-elle changer, et à quoi l'objet ressemblera-t-il un instant plus tard ? » Enfin, il utilise ce futur imaginé pour décider des mouvements précis nécessaires pour accomplir la tâche. Cette approche prospective permet au robot de planifier ses actions en fonction de la physique de l'interaction, plutôt que de simplement deviner en se basant sur des schémas passés.

Pour y parvenir, les chercheurs ont développé une méthode spéciale pour décider quand accorder sa confiance au sens du toucher. Dans de nombreuses tâches, un robot peut se déplacer dans l'air où le toucher est non pertinent, puis entrer soudainement en contact avec un objet. Si le robot prêtait une attention égale aux signaux tactiles à tout moment, il serait confus par le bruit de l'air ou l'absence de contact. DeCAL utilise un mécanisme de filtrage intelligent qui agit comme un bouton de volume pour le sens du toucher. Lorsqu'un robot ne touche rien, le système baisse le volume des signaux tactiles, se reposant principalement sur la vision. Dès qu'un contact est établi, le système augmente instantanément le volume, permettant aux données tactiles de guider le mouvement avec une grande précision. Cet ajustement dynamique garantit que le robot utilise le bon sens au bon moment, empêchant les entrées sensorielles de entrer en conflit les unes avec les autres.

Le système a été mis à l'épreuve lors d'une série d'expériences rigoureuses impliquant une paire de bras robotiques équipés de mains à vingt-deux doigts. Les chercheurs ont chargé le robot de six activités différentes : essuyer un vase, effacer un tableau blanc, assembler des pièces, tourner un bouchon, pipeter un liquide et visser une ampoule. Ces tâches ont été choisies car elles nécessitent toutes un contrôle fin et un contact physique constant. Le robot a été comparé à plusieurs autres modèles de pointe, incluant ceux qui ne reposent que sur la vision et ceux qui utilisent le toucher mais manquent de la capacité d'imaginer des états futurs. Les résultats étaient clairs : DeCAL a réussi à accomplir les tâches bien plus souvent que n'importe lequel des autres systèmes. Par exemple, pour la tâche de visser une ampoule, où la vision est souvent obstruée par la main et où la tâche exige un couple précis, DeCAL a réussi 40 % du temps, tandis que le second meilleur modèle n'a réussi que 35 %. Pour la tâche d'essuyer un vase, DeCAL a atteint un taux de réussite parfait de 100 %, alors que le meilleur modèle concurrent basé uniquement sur la vision n'a réussi que 30 % du temps.

Plus impressionnant encore était la capacité du système à gérer des situations qu'il n'avait jamais rencontrées auparavant. Les chercheurs ont testé DeCAL dans des environnements avec des arrière-plans différents, encombrés d'objets aléatoires, sous un éclairage tamisé, et avec des objets entièrement nouveaux ayant des formes et des tailles différentes. Dans ces scénarios « hors distribution », où le robot ne pouvait pas compter sur des schémas mémorisés, DeCAL a continué à performer solidement. Lorsqu'on lui a demandé de tourner un bouchon sur une tasse nouvelle et inconnue, le système a réussi 75 % du temps, surpassant nettement ses concurrents. Cela suggère que le robot ne fait pas que mémoriser un ensemble spécifique de mouvements, mais qu'il apprend réellement les principes physiques sous-jacents de l'interaction entre les objets, ce qui lui permet de s'adapter à de nouveaux défis à la volée.

Les chercheurs ont également examiné de près la façon dont le système apprend à prédire le futur. En analysant les prédictions internes du robot, ils ont découvert qu'il pouvait prévoir avec précision les forces et les déformations qui se produiraient lors d'une interaction. Lorsque le robot prédisait la force nécessaire pour tourner un bouchon ou comment une surface souple se déformerait, ces prédictions s'alignaient étroitement avec la réalité physique réelle. Cette capacité à simuler la physique du monde en interne est ce qui donne au robot son « bon sens ». Cela lui permet de comprendre que s'il pousse trop fort, l'objet pourrait glisser, ou s'il tourne trop lentement, la tâche prendra trop de temps. Cette connaissance implicite de la physique, dérivée de la combinaison de la vue et du toucher, est ce qui permet au robot d'agir avec une telle fluidité et une telle confiance.

Malgré ces succès, les auteurs prennent soin de noter les limites de leurs travaux. Le système repose lourdement sur la précision de ses capteurs tactiles, et si ces capteurs deviennent bruyants ou mal calibrés, les performances du robot pourraient se dégrader. De plus, la configuration actuelle nécessite qu'un opérateur humain démontre les tâches via un système de téléopération, lequel ne fournit pas à l'opérateur une sensation de toucher. Cela signifie que les données d'entraînement pourraient ne pas capturer parfaitement les ajustements subtils qu'un humain effectuerait s'il pouvait lui-même ressentir l'objet. Les chercheurs soulignent également que leur modèle n'a pas encore été entraîné sur une échelle massive de données tactiles diversifiées, suggérant que les améliorations futures pourraient provenir de l'exposition du système à une variété encore plus large d'interactions physiques.

Ce travail représente un changement dans notre conception de l'intelligence robotique. Plutôt que de construire des robots simplement plus rapides ou plus forts, cette approche se concentre sur la construction de machines capables de comprendre le monde physique comme un lieu dynamique et interactif. En donnant au robot la capacité d'imaginer les conséquences de ses actions et d'adapter ses sens à la situation, les chercheurs ont créé un système qui ressemble moins à une machine suivant un script qu'à un agent capable d'une véritable interaction. À mesure que la technologie mûrira, l'espoir est que ces systèmes puissent éventuellement accomplir les tâches complexes et riches en contacts qui définissent une grande partie de la vie humaine, de la cuisine et du nettoyage aux soins des personnes âgées, avec une dextérité qui égale la nôtre. La voie à suivre consiste à affiner ces capteurs, à étendre les données d'entraînement et à continuer de combler le fossé entre voir, sentir et agir.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →