← Derniers articles
💻 computer science

Towards Fine-Grained Object Manipulation: SAM3-Guided Visuomotor Policy with Persistent Memory Learning and Focused Visual Conditioning

Cet article présente un cadre visuomoteur guidé par SAM3, doté de FOM-SAM3 pour la mémoire persistante des objets et de FSAE pour un conditionnement visuel focalisé, permettant aux robots de distinguer et de manipuler de manière robuste des objets à grain fin au milieu de distracteurs et de similitudes visuelles.

Auteurs originaux : Haolong Meng, Fangbo Qin, Mengchen Bai, Houwu Wang, Cirong Liu, Shan Yu

Publié 2026-09-21
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Haolong Meng, Fangbo Qin, Mengchen Bai, Houwu Wang, Cirong Liu, Shan Yu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots sont depuis longtemps les maîtres des tâches larges et générales : ramasser une tasse, déplacer une boîte ou empiler des blocs. Pour ces tâches, les « yeux » d'un robot scannent généralement toute la pièce, cherchant n'importe quel objet correspondant à une description générale telle que « tasse » ou « boîte ». Cette approche fonctionne bien lorsque l'objectif est simplement de saisir une tasse. Mais le monde réel est bien plus spécifique. Imaginez qu'un humain demande de ramasser une canette de jus de fraise rouge spécifique sur une étagère encombrée de canettes de soda rouges, de canettes d'eau bleues et de canettes de thé vertes. Un humain reconnaît instantanément la marque, la saveur et les différences subtiles de l'étiquette. Un robot standard, cependant, ne voit souvent qu'une « canette rouge » et saisit la mauvaise, ou se laisse troubler par l'encombrement. Ce fossé entre la reconnaissance d'objets générale et la capacité de distinguer des détails fins — comme un modèle spécifique, un motif de couleur ou une marque — est la frontière de la manipulation à grain fin. Le défi n'est pas seulement de voir l'objet, mais de voir le bon objet parmi de nombreux autres qui lui ressemblent presque, et ensuite d'agir avec précision.

Une équipe de chercheurs a développé un nouveau système qui apprend aux robots à faire cette distinction, leur permettant de manipuler des articles spécifiques même lorsque des « jumeaux » visuellement similaires se trouvent à proximité. Leur approche, détaillée dans une étude récente, dépasse l'idée d'apprendre au robot une nouvelle compétence en partant de zéro chaque fois qu'il rencontre un nouvel objet. Au lieu de cela, ils ont créé un moyen pour le robot de construire une mémoire persistante des articles spécifiques qu'il a appris à reconnaître. Le système est construit sur un puissant modèle de fondation visuelle connu sous le nom de SAM3, qui est excellent pour trouver et détourer des objets dans des images. Cependant, la version standard de ce modèle est limitée ; on peut lui dire de trouver « une tasse », mais il peine à trouver « la tasse bleue spécifique avec l'éclat sur le bord » si une autre tasse bleue presque identique se trouve juste à côté. Les chercheurs ont résolu ce problème en créant une « banque de mémoire » où le robot stocke des empreintes numériques uniques pour chaque objet spécifique qu'il doit apprendre à reconnaître.

Pour construire cette mémoire, les chercheurs n'ont pas réentraîné l'ensemble du système visuel massif, ce qui serait lent et coûteux en termes de calcul. Au lieu de cela, ils ont gardé le moteur visuel central gelé et lui ont appris un nouveau tour : comment associer un ensemble spécifique de « jetons » (tokens) internes à un objet spécifique. Ils ont montré au robot quelques dizaines de photos d'un article cible, tel qu'une canette de jus de fraise Wontae rouge, sur un fond neutre. À travers un processus d'apprentissage de ce qui rend cette canette spécifique différente des autres canettes rouges, le système a généré un ensemble compact de jetons de mémoire. Ces jetons agissent comme une carte d'identité persistante pour cet objet spécifique. Une fois stockés, le robot peut récupérer cette carte d'identité chaque fois qu'il doit retrouver cette canette spécifique, même s'il se trouve dans une autre pièce, sous un éclairage différent ou entouré de sosies déroutants. Cela permet au robot de passer d'une tâche à l'autre simplement en échangeant le jeton de mémoire qu'il recherche, plutôt qu'en réapprenant toute la tâche.

La seconde innovation majeure réside dans la manière dont le robot utilise cette mémoire pour décider de son action. Dans de nombreux systèmes robotiques, l'information visuelle est un mélange flou de l'ensemble de la scène, ce qui peut distraire la prise de décision du robot. Les chercheurs ont introduit une méthode appelée encodage spatial-apparence focalisé (focused spatial-appearance encoding). Cette technique force le robot à ignorer tout ce qui se trouve à l'extérieur de l'objet cible. Elle prend la forme et l'emplacement exacts de la cible, identifiés par les jetons de mémoire, et extrait uniquement les détails visuels à l'intérieur de cette forme. Elle combine cela avec les coordonnées précises de l'endroit où l'objet est posé. En ne fournissant au planificateur d'action du robot que ces données focalisées et de haute qualité, le système garantit que le robot réagit à l'article spécifique qu'on lui a demandé de trouver, et non au désordre environnant ou aux voisins aux apparences similaires. Cette vue focalisée est ensuite transmise au logiciel de contrôle du robot, qui calcule les mouvements fluides nécessaires pour saisir ou pousser l'objet.

Les chercheurs ont testé ce système sur un véritable bras robotique équipé de deux caméras, l'une fournissant une vue à la troisième personne de la table et l'autre montée sur le bras pour une perspective à la première personne. Ils ont créé un ensemble de données de trente objets physiques différents, allant de canettes et de tasses à des couvercles et des boîtes, dont beaucoup possédaient des homologues visuellement similaires. Dans une série de tests, on a demandé au robot de ramasser une canette spécifique alors que d'autres canettes de même couleur mais de marques différentes étaient placées à proximité. Les politiques robotiques standards, qui reposent sur des descriptions de scènes générales, ont échoué fréquemment dans ces scénarios, saisissant souvent la mauvaise canette ou étant confus par les éléments de distraction. Le nouveau système, cependant, a identifié et manipulé avec succès la cible correcte dans presque tous les essais. Lorsque les chercheurs ont remplacé la cible par un autre objet du même type mais d'une marque différente, le robot a simplement récupéré le nouveau jeton de mémoire et a effectué la tâche correctement sans aucun nouvel entraînement ni démonstration.

Les résultats ont montré que le système pouvait distinguer des objets visuellement presque identiques, une tâche qui déconcertait les autres méthodes. Dans des tests où le robot devait choisir un article spécifique parmi un groupe de trois ou quatre objets similaires, la nouvelle approche a maintenu un taux de réussite élevé, tandis que les autres méthodes ont vu leurs performances chuter considérablement. Le système s'est également montré robuste lorsque le robot devait déplacer l'objet vers un nouvel emplacement, car l'encodage visuel focalisé l'a aidé à suivre le changement de position et d'orientation de l'article. Les chercheurs ont noté que le système n'est pas parfait : si les caractéristiques uniques d'un objet sont cachées, comme l'étiquette d'une canette tournée à l'opposé de la caméra, le robot ne peut pas l'identifier. De plus, en se concentrant de manière aussi stricte sur la cible, le robot pourrait manquer d'autres obstacles dans la scène, ce qui pourrait être une limitation pour la navigation dans des environnements complexes. Néanmoins, ce travail constitue une étape importante pour donner aux robots la capacité de gérer les exigences subtiles et spécifiques des tâches du monde réel, les faisant passer de simples préhenseurs généraux à des opérateurs précis capables de distinguer le familier du déroutant.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →