← Derniers articles
💻 computer science

GPA-RAM: Grasp-Pretraining Augmented Robotic Attention Mamba for Spatial Task Learning

Le document propose GPA-RAM, un nouveau cadre qui intègre l'augmentation par pré-entraînement de la saisie (Grasp-Pretraining Augmentation) pour améliorer les taux de réussite de la manipulation et emploie une architecture Robotic Attention Mamba pour une génération d'actions efficace et en temps réel, atteignant des performances de pointe sur de multiples plateformes robotiques.

Auteurs originaux : Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

Publié 2026-08-03
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un robot à faire vos corvées. Vous ne voulez pas écrire un million de lignes de code pour lui dire exactement comment bouger ses doigts pour chaque objet de votre maison. Au lieu de cela, vous voulez lui montrer quoi faire, comme un parent apprenant à un enfant à empiler des blocs ou à mettre une cuillère dans une tasse. C'est le monde de l'apprentissage par imitation robotique. C'est une branche de la science où les robots apprennent en observant et en copiant des démonstrations humaines. Le grand défi ? Les robots sont excellents pour bouger leurs bras, mais ils sont souvent très mauvais lors de la toute première étape : saisir le bon objet de la bonne manière. Si un robot saisit une tasse par le rebord au lieu de la poignée, ou manque une cheville d'un millimètre, toute la tâche peut échouer, et le robot pourrait ne pas savoir comment corriger le tir. Les scientifiques essaient constamment de construire des « cerveaux » pour les robots qui puissent voir une pièce en désordre, déterminer la meilleure façon de tenir un objet, puis le déplacer parfaitement sans rien percuter.

Maintenant, faites la connaissance de GPA-RAM, un nouveau cerveau robotique conçu pour résoudre précisément ce problème de « saisir et aller ». Les chercheurs derrière ce projet ont réalisé que de nombreux robots échouent parce qu'ils ne prêtent pas assez attention à la manière dont ils tiennent un objet avant même de commencer à bouger. Ils ont construit un système qui combine deux astuces ingénieuses. Premièrement, ils ont donné au robot un « pré-entraînement » sur la façon de saisir les choses, en utilisant les mêmes vidéos qu'il utilise pour apprendre le reste de la tâche. C'est comme donner à un étudiant un petit quiz sur la façon de tenir un crayon avant de lui demander d'écrire une dissertation ; le robot apprend la prise avant d'essayer de résoudre l'énigme. Deuxièmement, ils ont remplacé le moteur de réflexion lent et lourd du robot par un nouveau moteur ultra-rapide appelé RAM (Robotic Attention Mamba). Considérez RAM comme un bibliothécaire super efficace capable de parcourir une immense bibliothèque d'informations visuelles et de trouver le bon livre en une fraction de seconde, là où les anciens systèmes seraient submergés et ralentiraient.

L'équipe a testé ce nouveau cerveau sur quatre configurations de robots différentes, incluant des robots physiques réels et des robots simulés. Ils ont découvert qu'en ajoutant le « pré-entraînement à la saisie », le robot devenait bien meilleur pour des tâches complexes comme empiler des tasses, insérer des chevilles dans des trous et déplacer des objets entre deux bras. Sur un test standard appelé RLBench, le nouveau système a réussi 87,5 % du temps, battant les meilleures méthodes précédentes. Plus impressionnant encore, sur une tâche de robot à deux bras impliquant le déplacement d'un cube, il a réussi 98 % du temps, et sur une tâche d'insertion à deux mains particulièrement difficile, il est passé d'un taux de réussite de 16 % à 56 %. Le meilleur dans tout ça ? Il a fait tout cela en tournant à environ 71 images par seconde, ce qui signifie qu'il réfléchit assez vite pour réagir en temps réel sans rester bloqué. Les chercheurs suggèrent que cette approche consistant à apprendre aux robots à « saisir d'abord, puis agir » pourrait les rendre beaucoup plus fiables en tant qu'assistants dans le monde réel, en gérant des tâches délicates qui, auparavant, causaient leur échec.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →