← Derniers articles
💻 computer science

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

L'article propose CAST, une méthode qui exploite les modèles vision-langage pour générer des étiquettes contrefactuelles afin d'augmenter les jeux de données robotiques, améliorant ainsi considérablement les capacités de suivi d'instructions des modèles vision-langage-action sans nécessiter de collecte de données supplémentaires.

Auteurs originaux : Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

Publié 2026-06-10
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot comment naviguer dans une maison ou ramasser des objets. Vous lui montrez une vidéo d'un robot marchant dans un couloir et tournant à droite. Vous dites au robot : « Voici à quoi ressemble "aller tout droit". »

Le problème est que le robot est un peu un élève paresseux. Il remarque que chaque fois qu'il voit un couloir, le robot dans la vidéo tourne à droite. Il apprend donc un raccourci : « Si je vois un couloir, je tourne à droite. » Il cesse d'écouter vos instructions spécifiques (comme « tourne à gauche à la table bleue ») parce qu'il pense que l'image du couloir lui dit tout ce qu'il a besoin de savoir. Dans les termes techniques de l'article, cela s'appelle l'« effondrement de la distribution a posteriori » (posterior collapse) : le robot ignore votre voix et se contente de deviner en fonction de ce qu'il voit.

La solution CAST : Le jeu du « Et si ? »

Les auteurs de cet article, de l'UC Berkeley et de Princeton, ont trouvé une astuce ingénieuse pour corriger cela. Ils appellent cela CAST (Counterfactual Labels Improve Instruction Following).

Considérez CAST comme un coach en écriture créative pour les robots. Au lieu de simplement montrer au robot le seul chemin qu'il a réellement emprunté, le coach lui demande de jouer à un jeu de « Et si ? »

Voici comment cela fonctionne, étape par étape :

  1. La scène originale : Le robot a une vidéo de lui-même marchant dans un couloir.
  2. La question « Et si ? » : Les chercheurs utilisent une IA très intelligente (un modèle vision-langage) pour regarder ce même couloir et demander : « Hé, qu'est-ce que le robot aurait pu faire d'autre ici ? »
    • Original : « Aller tout droit. »
    • Contrefactuel (Et si ?) : « Tourner à droite à la table orange », ou « Se déplacer le long du mur sur la gauche ».
  3. Inventer le chemin : L'IA ne se contente pas d'inventer une phrase ; elle invente aussi un faux chemin vidéo qui correspond à cette nouvelle phrase. Elle imagine : « D'accord, si le robot tournait à droite à la table orange, à quoi ressembleraient les quelques secondes suivantes ? »
  4. La nouvelle leçon : Désormais, le robot a deux leçons pour ce même couloir :
    • Leçon A : « Aller tout droit » (la vidéo réelle).
    • Leçon B : « Tourner à droite à la table orange » (la vidéo inventée).

Pourquoi cela change tout

Avant cette astuce, le robot voyait un couloir et pensait : « Je connais ça ! Je tourne à droite ! » Il n'avait pas besoin d'écouter vos mots.

Après l'astuce CAST, le robot voit le même couloir mais réalise : « Attendez, parfois je vais tout droit, et parfois je tourne à droite à la table orange. L'image seule ne me dit pas quoi faire. Je dois écouter les mots spécifiques que vous donnez pour savoir quel chemin prendre. »

Les résultats

Les chercheurs ont testé cela sur deux types de robots :

  • Robots de navigation : Des robots qui se déplacent à l'intérieur et à l'extérieur.
  • Robots de manipulation : Des bras robotisés qui ramassent des objets comme du brocoli ou des cuillères.

Ils ont constaté qu'en utilisant ces données de type « Et si » (sans avoir besoin de collecter de nouvelles vidéos réelles), les robots sont devenus bien meilleurs pour suivre des instructions.

  • En navigation, le taux de réussite a doublé par rapport aux robots entraînés sans cette astuce.
  • Dans les tâches de manipulation (comme ramasser des objets à proximité d'objets distrayants), les robots se sont améliorés de 27 %.

L'essentiel à retenir

CAST est comme si l'on donnait à un robot une bibliothèque de « réalités alternatives ». En montant au robot que la même scène peut mener à des résultats différents selon l'instruction, cela le force à arrêter de deviner et à commencer à écouter. Cela transforme un robot qui se contente de « regarder et deviner » en un robot qui « écoute et agit » véritablement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →