← Derniers articles
💻 computer science

Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA

L'article présente Cloak, une méthode d'entraînement qui permet aux modèles Vision-Langage-Action de parvenir à une manipulation inter-incarnation zero-shot en masquant l'effecteur terminal des vues de la caméra du poignet lors de l'entraînement, permettant ainsi à un modèle entraîné sur un seul robot de se généraliser à un matériel inédit sans collecter de nouvelles données.

Auteurs originaux : Michael Piseno, Guy Tevet, C. Karen Liu

Publié 2026-06-23
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Michael Piseno, Guy Tevet, C. Karen Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous appreniez à un robot à ramasser une tasse. Vous lui montrez une vidéo provenant de son propre « œil » (une caméra située sur son poignet). Le problème, c'est que dans cette vidéo, la main du robot (la pince) occupe une énorme partie de l'écran.

Si vous entraînez un robot avec un type de main spécifique — par exemple, une simple pince à deux doigts — il apprend à reconnaître cette forme précise. Si vous remplacez ensuite la main de ce robot par une main complètement différente, comme une main humaine à cinq doigts, le robot est confus. C'est comme si vous appreniez à quelqu'un à conduire une voiture en ne lui montrant que le volant d'une Ford. Si, soudainement, vous le mettez dans une Tesla avec un volant différent, il pourrait paniquer parce que la « carte visuelle » dans son cerveau ne correspond plus à ce qu'il voit.

Le Problème : La distraction de la « Main »
Dans le monde de la robotique, la collecte de données est coûteuse et lente. Nous disposons de vastes bibliothèques de données montrant des robots avec des pinces à deux doigts effectuant des tâches. Mais l'avenir de la robotique s'oriente vers des mains complexes à plusieurs doigts. Nous voulons utiliser nos anciennes données pour enseigner à ces nouvelles mains, mais la main de l'ancien robot ne ressemble en rien à la nouvelle. Le cerveau du robot est trop concentré sur la forme spécifique de l'ancienne main pour comprendre la nouvelle.

La Solution : « Cloak »
Le papier présente une astuce ingénieuse appelée Cloak. Voyez cela comme un « bandeau » ou un « museau » numérique pour la vision du robot.

  1. Cacher la main : Au lieu de laisser le robot voir sa propre main dans le flux de la caméra, Cloak recouvre numériquement la main avec un masque. C'est comme mettre un morceau de ruban adhésif sur la partie de l'objectif de la caméra où la main apparaît.
  2. Apprendre la scène, pas la main : En cachant la main, le robot est forcé de regarder le reste du monde — la table, la tasse, les obstacles. Il apprend la logique de la tâche (par exemple, « avancer jusqu'à toucher la tasse ») sans être distrait par la forme spécifique de ses propres doigts.
  3. L'entraînement « Caméléon » : Pour s'assurer que le robot n'apprenne pas simplement à ignorer une forme de ruban adhésif spécifique, les chercheurs changent aléatoirement la forme du « bandeau » pendant l'entraînement. Parfois le masque est grand, parfois petit, parfois de forme étrange. Cela apprend au robot que « ma main pourrait être différente demain, donc je ne devrais pas me fier à ce que je vois ».

Comment cela fonctionne en conditions réelles
Lorsque le robot exécute réellement la tâche :

  • Les Yeux : Le flux de la caméra contient toujours la main, mais le logiciel couvre instantanément la main avec un masque numérique avant que le cerveau du robot ne la voie.
  • Le Cerveau : Le cerveau du robot (un modèle de Vision-Langage-Action) voit une image masquée et une commande textuelle comme « ramasser la tasse ». Il détermine le mouvement en fonction de l'environnement.
  • Le Corps : Une fois que le cerveau décide « déplacer mes extrémités de doigts vers ce point », un traducteur (appelé rétargeting de pose de pointe ou tip-pose retargeting) convertit cette instruction en les mouvements musculaires spécifiques nécessaires pour la nouvelle main. Si la nouvelle main possède cinq doigts, le système comprend comment bouger ces cinq doigts pour correspondre au plan initial à deux doigts.

Les Résultats
Les chercheurs ont testé cela en entraînant un robot sur une simple pince à deux doigts en utilisant des données existantes. Ensuite, ils ont tenté d'utiliser ce même cerveau entraîné sur trois robots complètement différents qu'il n'avait jamais vus auparavant :

  1. Une autre pince à deux doigts (de couleur et de forme différentes).
  2. Un bras robotique entièrement différent.
  3. Une main complexe à cinq doigts, semblable à une main humaine.

Le Résultat :

  • Sans Cloak : Le robot a échoué lamentablement sur les nouvelles mains. Il était confus car la carte visuelle ne correspondait pas.
  • Avec Cloak : Le robot a performé presque aussi bien sur les nouvelles mains que sur l'originale. Il a réussi à transférer ses compétences en « zero-shot » (ce qui signifie qu'il n'a pas eu besoin de nouvelles données d'entraînement pour les nouvelles mains).

La Grande Leçon
Cloak prouve que l'on peut séparer le « cerveau » du robot (la compétence d'accomplir une tâche) de son « corps » (le matériel spécifique). En cachant le corps de la vue du cerveau pendant l'apprentissage, les données collectées sur un robot peuvent être réutilisées sur des robots complètement différents à l'avenir. C'est comme apprendre à quelqu'un à nager en lui faisant porter un bandeau pour qu'il se concentre sur le mouvement de l'eau plutôt que sur ses propres membres ; une fois qu'il a appris le rythme de l'eau, il peut nager avec n'importe quel type de palmes.

Limites
Le papier note que cela fonctionne mieux pour des tâches qui peuvent être accomplies en plaçant deux points (comme deux bouts de doigts) sur un objet. Cela ne résout pas encore les tâches complexes qui nécessitent une manipulation complexe à l'intérieur de la main (comme jongler avec une balle à l'intérieur d'une main), car celles-ci dépendent fortement du toucher et de la forme spécifique des doigts.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →