← Derniers articles
💻 computer science

Vision-Force Admittance Learning for Peg Insertion into a Movable Hole

Cet article propose un cadre d'apprentissage d'admittance vision-force (VFAL) qui fusionne le retour visuel asynchrone issu de modèles de fondation avec un contrôle de force à haute fréquence afin de permettre une insertion de type pion-dans-trou robuste et d'une précision millimétrique dans des trous en mouvement au sein d'environnements dynamiques.

Auteurs originaux : Yuzhong Chen, Yongqing Liang, Yunzhi Xu, Irving Fang, Chase Kidder, Hui-ping Wang, Raihan Haque, Yubiao Zhang, Chen Feng

Publié 2026-09-16
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yuzhong Chen, Yongqing Liang, Yunzhi Xu, Irving Fang, Chase Kidder, Hui-ping Wang, Raihan Haque, Yubiao Zhang, Chen Feng

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde calme et contrôlé d'un atelier d'usine, un bras robotisé peut être une merveille de précision. Il peut ramasser une vis et la visser dans un trou avec une régularité qu'aucune main humaine ne peut égaler, à condition que le trou ne bouge pas. C'est le domaine de la manipulation statique, où la cible reste immobile et où le défi du robot consiste simplement à trouver son chemin vers un point fixe. Mais le monde réel est rarement aussi immobile. Imaginez une pièce de voiture se déplaçant sur un convoyeur, ou un robot monté sur un véhicule circulant sur un terrain accidenté. Dans ces environnements dynamiques, la cible est en mouvement, et le robot doit non seulement trouver le trou, mais aussi le poursuivre, tout en maintenant la précision millimétrique requise pour insérer une cheville dans un espace étroit. C'est un conflit fondamental : le besoin d'une précision extrême entre en collision avec le chaos d'une cible mouvante. Les robots traditionnels peinent ici car ils reposent soit sur une vision de haut niveau, lente, pour voir où se trouve le trou, soit sur des capteurs de toucher locaux, rapides, pour ressentir le moment du contact. La vision est trop lente pour réagir aux changements soudains, tandis que le toucher seul ne peut pas voir assez loin devant pour planifier une trajectoire fluide.

Des chercheurs de l'Université de New York et de General Motors ont développé une nouvelle façon de résoudre ce problème, créant un système qui permet à un robot d'insérer une cheville dans un trou en mouvement avec un succès remarquable. Ils appellent leur méthode « Vision-Force Admittance Learning » (Apprentissage par admittance vision-force). Au lieu de forcer le robot à choisir entre voir et ressentir, ce système permet aux deux sens de travailler ensemble selon un rythme asynchrone spécifique. Le robot utilise une caméra pour estimer où se trouve le trou, mais comme les caméras sont lentes, cette information est traitée comme un guide général plutôt que comme une commande stricte. Simultanément, le robot s'appuie sur un capteur de force situé à son poignet, qui réagit des centaines de fois par seconde à la pression physique de la cheville touchant le trou. L'innovation réside dans la manière dont ces deux flux de données sont combinés. Le capteur de force rapide effectue les ajustements immédiats et instantanés nécessaires pour maintenir l'alignement de la cheville, tandis que la caméra plus lente met à jour la compréhension par le robot de la position globale du trou. Cette mise à jour visuelle agit comme une correction douce, ou un régularisateur, qui empêche le robot de trop s'écarter de sa trajectoire, même lorsque le capteur de force gère les vibrations rapides et chaotiques de l'insertion.

Pour tester cela, l'équipe a construit une expérience en conditions réelles impliquant un bras robotisé tenant une cheville et une base comportant un trou qui pouvait se déplacer. Ils ont utilisé un type spécial de fixation, un écrou à expansion (pushnut) avec des ailettes flexibles, courant dans l'assemblage industriel. L'installation comprenait une caméra pour observer la scène et un capteur de force pour ressentir le contact. Ils ont testé le robot dans trois scénarios différents : un trou immobile, un trou se déplaçant en ligne droite, et un trou se déplaçant en trois dimensions sur un support motorisé. Les résultats ont été frappants. Lorsque le trou était en mouvement, un robot s'appuyant uniquement sur la vision échouait à insérer la cheville la plupart du temps, tandis qu'un robot s'appuyant uniquement sur des capteurs de force éprouvait également des difficultés, perdant souvent sa trajectoire ou appliquant trop de force. Cependant, le nouveau système, qui fusionne ces deux sens, a atteint un taux de réussite de 80 % dans le scénario le plus difficile du mouvement en trois dimensions. Dans le scénario de mouvement en ligne droite, il a réussi à chaque fois.

Les chercheurs ont découvert que la clé de ce succès n'était pas seulement d'avoir les deux capteurs, mais la manière dont ils étaient synchronisés. Ils ont comparé leur méthode à une version où les données de vision et de force étaient forcées de s'attendre mutuellement, un processus qui ralentissait tout. En laissant le capteur de force rapide piloter le mouvement pendant que le système de vision plus lent mettait à jour l'objectif en arrière-plan, le robot pouvait réagir instantanément au contact physique sans perdre son sens global de la direction. Ils ont également découvert que le système pouvait se rétracter après une erreur. Si la caméra perdait la trace du trou, le robot s'écartait en toute sécurité et attendait le retour de la vision. Si la cheville restait coincée ou si les lectures de force indiquaient un mauvais angle, le robot pouvait lever la cheville et réessayer. Cette capacité à s'adapter et à se rétablir a rendu le système assez robuste pour gérer la nature imprévisible d'une cible mouvante.

L'étude a également exploré comment différents réglages affectaient le résultat. Ils ont découvert que l'équilibre entre la confiance accordée à la position de la caméra et le retour du capteur de force était critique. Si le robot faisait trop confiance à la caméra, il ignorait la réalité physique de la cheville heurtant le côté du trou. S'il faisait trop confiance au capteur de force, il dérivait sans but lorsque le trou se déplaçait. En trouvant un juste milieu, le robot a appris à utiliser la caméra pour rester sur la bonne voie et le capteur de force pour effectuer les ajustements fins nécessaires pour faire glisser la cheville. Cette approche a fonctionné même lorsque la cible se déplaçait de manières complexes et non linéaires, prouant que le système pouvait gérer plus que de simples mouvements prévisibles.

En fin de compte, ce travail démontre que les robots peuvent être enseignés pour accomplir des tâches délicates dans des environnements qui ne sont pas parfaitement immobiles. En combinant la vue large et lente d'une caméra avec le toucher rapide et sensible d'un capteur de force, les chercheurs ont créé une méthode qui imite la façon dont les humains pourraient manipuler un objet en mouvement : en utilisant nos yeux pour savoir où aller et nos mains pour ressentir le chemin. Le système ne nécessite pas que le robot soit parfait dès le départ ; il permet les erreurs et les corrige en temps réel. Bien que le système actuel suppose que le robot a déjà ramassé la cheville, la capacité d'insérer celle-ci dans un trou en mouvement est une étape importante vers des robots capables de travailler aux côtés des humains dans des contextes dynamiques et réels, des lignes d'assemblage aux véhicules mobiles, sans avoir besoin que l'environnement s'arrête pour eux.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →