← Derniers articles
🤖 AI

Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT

Ce document présente un pipeline perception-action pour des tâches robotiques de saisie et de placement dans des environnements de supérettes encombrés, qui combine le prompting visuel guidé par l'annotation pour identifier les cibles avec l'Action Chunking with Transformers (ACT) afin de générer des séquences de saisie adaptatives et fondées sur les données à partir de démonstrations humaines.

Auteurs originaux : Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

Publié 2026-08-19
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé technique : Prompting visuel pour la manipulation robotique avec un guidage par annotation pour les tâches de type « pick-and-place » utilisant l'ACT

Problématique
Les tâches de saisie et de dépose (pick-and-place) par des robots dans des environnements de supérettes font face à des obstacles importants dus à la densité de l'arrangement des objets, aux occlusions fréquentes et à la grande variabilité des propriétés des objets (couleur, forme, taille, texture). Les approches traditionnelles reposant sur des heuristiques prédéfinies, des environnements structurés ou une segmentation exhaustive de la scène manquent souvent de l'adaptabilité requise pour des articles nouveaux et des dispositions dynamiques. De plus, la planification conventionnelle étape par étape peut être sujette aux erreurs lors de tâches à long horizon, entraînant une accumulation d'erreurs et des échecs.

Méthodologie
Les auteurs proposent un pipeline perception-action qui combine le prompting visuel guidé par annotation avec l'Action Chunking with Transformers (ACT), un algorithme d'apprentissage par imitation.

  • Prompting Visuel : Au lieu d'exiger que le robot effectue une analyse de scène complexe et exhaustive, le système utilise des annotations de boîtes englobantes (bounding boxes) pour fournir un guidage spatial structuré. Ces annotations identifient explicitement l'objet cible à saisir et la destination pour la dépose. Le système utilise deux caméras Intel RealSense (D435i au poignet et D415 sur la table) pour capturer les données RVB et de profondeur. Les images RVB, augmentées de prompts visuels (boîtes englobantes), servent d'entrées directes au réseau neuronal.
  • Action Chunking with Transformers (ACT) : L'algorithme de contrôle central est l'ACT, qui remplace la planification rigide étape par étape par la prédiction de séquences d'actions « par blocs » (chunks).
    • Architecture : Le modèle utilise une architecture basée sur les Transformers. Un encodeur CVAE traite les données de démonstration humaine (actions et observations sans images) pour générer une variable latente (zz). Un décodeur Transformer prédit ensuite une séquence d'actions futures (un « chunk ») basée sur l'état actuel, la variable latente et l'entrée visuelle (image RVB avec boîtes englobantes).
    • Entraînement : Le système est entraîné via l'apprentissage par imitation en utilisant des démonstrations humaines collectées par téléopération (souris 3D). L'objectif d'entraînement consiste à minimiser l'erreur de reconstruction entre les chunks d'actions prédits et réels, régularisée par un terme de divergence KL.
  • Configuration Expérimentale : Le système a été implémenté sur un bras Universal Robots UR5e équipé d'une pince à deux doigts Robotiq. Les expériences ont été menées dans un cadre de supérette simulé et réel utilisant six catégories de produits distinctes (ex: bols de nouilles, boîtes de chocolat, bouteilles de thé) représentant diverses formes, textures et matériaux.

Principales Contributions

  1. Prompting Visuel Guidé par Annotation : L'introduction du prompting visuel basé sur des boîtes englobantes pour guider la manipulation robotique. Cette approche réduit la complexité de la compréhension de la scène tout en assurant l'exécution de la tâche en fournissant des indices spatiaux légers et efficaces.
  2. Système Adaptatif Basé sur l'ACT : L'implémentation de l'ACT pour permettre au bras robotique d'exécuter des séquences d'actions fluides et par blocs dérivées de démonstrations humaines, plutôt que de s'appuyer sur une planification incrémentale rigide.
  3. Cadre d'Évaluation Systématique : Une analyse expérimentale structurée à travers trois niveaux progressifs de complexité de tâche (scénarios Simples, Complexes et Plus Complexes) pour évaluer comment le prompting visuel et la diversité des objets influencent la performance robotique.

Résultats
Le système a été évalué à travers trois scénarios impliquant des arrangements de 3x3 produits :

  • Scénario Simple : Neuf boîtes similaires avec une cible annotée. Le système a atteint un taux de réussite de 90 %, démontant sa fiabilité dans des environnements uniformes.
  • Scénario Complexe : Neuf produits divers avec une cible annotée. Les taux de réussite initiaux sont tombés à 70 % en raison des variations des propriétés des objets (réflectivité, glissance). Après avoir augmenté les données de démonstration de 20 % spécifiquement pour les cas d'échec, la performance du système s'est considérablement améliorée, atteignant un taux de réussite de 100 % pour toutes les catégories d'objets dans ce scénario.
  • Scénario Plus Complexe : Neuf produits divers dans des positions variables avec les lieux de saisie et de dépose tous deux annotés. Le succès initial était de 70 %. En raison de la difficulté accrue, les chercheurs ont collecté le double de données annotées par l'humain pour chaque produit. Suite à cette augmentation de données, la performance s'est améliorée, bien que certaines catégories d'objets spécifiques (ex: bouteilles de thé réfléchissantes, bocaux glissants) présentent encore des taux de réussite inférieurs (80 %) par rapport aux boîtes rigides (90 %).

Analyse des Échecs
L'étude a identifié des modes d'échec spécifiques, notamment le désalignement des doigts, une force de préhension faible entraînant un glissement (particulièrement sur les surfaces glissantes) et un désalignement lors de la dépose. Les cartes de chaleur d'attention (attention heatmaps) ont révélé que le modèle ACT parvient à déplacer son attention de la zone de saisie vers la zone de dépose, adaptant sa stratégie selon les prompts visuels. Cependant, les objets dotés de surfaces réfléchissantes ou de textures molles ont présenté des défis persistants, menant à des désalignements et des échecs de saisie.

Signification et Revendications
L'article affirme que la combinaison du prompting visuel et de l'action par blocs permet aux robots d'interpréter efficacement des annotations minimales mais informatives pour des tâches de manipulation dans le monde réel. La méthode proposée représente une avancée vers la création de systèmes robotiques adaptatifs capables de gérer des variations d'objets complexes avec une autonomie et une robustesse accrues.

Les auteurs maintiennent une position modeste concernant les limites de leur travail. Ils reconnaissent explicitement que le système est exigeant en termes de données, reposant fortement sur des données de démonstration humaines diverses et de haute qualité. Par conséquent, l'article ne revendique pas de généralisation universelle sans données d'entraînement suffisantes. Les travaux futurs sont identifiés comme se concentrant sur l'augmentation des données pour étendre artificiellement les jeux de données, plutôt que de revendiquer des solutions immédiates à la rareté des données. L'étude conclut que, bien que l'approche améliore la stabilité de la saisie et la précision de la dépose, l'efficacité reste liée à la qualité et à la quantité des démonstrations d'entraînement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →