← Derniers articles
💻 computer science

ContactMimic: Humanoid Object Interaction via Contact Control

ContactMimic est un cadre d'apprentissage qui améliore l'interaction entre humanoïdes et objets en suivant explicitement des commandes de contact binaires parallèlement aux trajectoires de points clés, permettant un contact physique précis et un contrôle du contact à la demande à travers diverses tâches de manipulation.

Auteurs originaux : Xinyao Li, Xialin He, Runpei Dong, Saurabh Gupta

Publié 2026-07-10
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xinyao Li, Xialin He, Runpei Dong, Saurabh Gupta

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous appreniez à un robot à danser. Pendant longtemps, la meilleure façon de le faire consistait à donner au robot une vidéo d'un danseur humain et à lui dire : « Copie exactement ces positions corporelles. » Le robot déplaçait ses articulations pour correspondre parfaitement aux hanches, aux coudes et aux genoux de l'humain.

Mais voici le problème : copier simplement la forme de la danse ne suffit pas.

Si un danseur humain agite la main près d'un tableau blanc, il ne fait qu'agiter la main. S'il appuie sa main contre le tableau blanc, il est en train de l'essuyer. Si un robot ne regarde que la position de la main, il pourrait agiter la main juste à côté du tableau et penser qu'il fait du bon travail, même s'il n'est pas réellement en train de nettoyer quoi que ce soit. C'est comme essayer d'ouvrir une porte en se tenant juste à côté, sans jamais toucher la poignée.

C'est l'idée centrale derrière un nouveau projet appelé CONTACTMIMIC. Les chercheurs ont découvert que pour rendre un robot vraiment utile pour des tâches comme s'asseoir, essuyer ou pousser des meubles, on ne peut pas seulement lui dire où être ; il faut lui dire s'il doit toucher les choses.

L'« interrupteur magique » pour le toucher

L'équipe a construit un système où, au lieu de simplement donner un chemin à suivre au robot, elle lui donne un interrupteur. Cet interrupte est une simple étiquette « Oui/Non » pour chaque partie du corps du robot.

  • Interrupteur ON (Contact ✔) : « D'accord, robot, je veux que tu presses ta main contre ce tableau blanc. »
  • Interrupteur OFF (Contact ✘) : « D'accord, robot, déplace ta main exactement au même endroit, mais ne touche pas le tableau. Contente-toi de planer au-dessus. »

Dans leurs tests, ils ont montré qu'avec cet interrupteur, le même robot pouvait effectuer exactement les mêmes mouvements de danse mais changer complètement de comportement. Il pouvait s'asseoir dans une chaise et s'appuyer en arrière, ou s'asseoir dans cette même chaise et rester droit sans toucher le dossier. Il pouvait ramasser une boîte, ou simplement tenir ses mains en forme de saisie d'une boîte sans réellement la soulever.

Pourquoi était-ce si difficile ?

Vous pourriez vous dire : « Pourquoi ne pas simplement apprendre au robot à toucher les objets naturellement ? » Les chercheurs ont découvert un piège sournois dans les données.

Lorsque les humains interagissent avec des objets, leurs positions corporelles et leurs contacts sont généralement liés de manière indissociable. Si un humain s'assoit sur une chaise, son derrière est toujours en contact avec l'assise. Si un humain essuie un tableau, sa main est toujours en contact avec la surface. Par conséquent, si vous montrez simplement à un robot des milliers de vidéos de personnes assises, le robot apprend : « Oh, si les hanches sont dans cette position, le derrière doit être en contact avec la chaise. » Il cesse d'écouter la commande de « contact » parce qu'il pense que la position raconte toute l'histoire.

Pour correr cela, l'équipe a dû faire preuve de créativité. Ils ont pris leurs données d'entraînement et ont commencé à briser les règles :

  1. L'objet « Fantôme » : Ils ont pris une vidéo de quelqu'un essuyant un tableau mais ont dit au robot : « Le tableau n'est pas là. » Le robot a dû apprendre à déplacer sa main à l'endroit du tableau sans toucher quoi que ce soit.
  2. L'objet « Gonflé » : Ils ont rendu les objets dans la simulation plus gros (comme un ballon que l'on gonfle) afin que le robot doive déplacer sa main autour de l'objet pour l'éviter, même si la commande de « contact » indiquait qu'il devrait le toucher.
  3. Le faux contact : Ils ont pris une vidéo où le robot était censé toucher, mais ils lui ont dit : « Ne touche pas », et vice versa.

En mélangeant tout cela, ils ont forcé le robot à arrêter de deviner en fonction de la position et à commencer à réellement écouter l'interrupteur de contact.

Est-ce que cela a fonctionné ?

L'équipe a testé cela sur un vrai robot appelé le Unitree G1 (un humanoïde à 29 articulations) et dans une simulation informatique.

  • Dans la simulation : Ils ont exécuté 10 tâches différentes, comme donner un coup de pied dans une chaise, monter sur une chaise et ramasser une boîte. Lorsqu'ils basculaient l'interrupteur sur « Contact », le robot établissait le contact. Lorsqu'ils le basculaient sur « Pas de contact », le robot cessait de toucher. Le robot pouvait même soulever une boîte simplement en lui demandant de la toucher, sans avoir besoin d'instructions spéciales de type « soulève la boîte ».
  • Dans le monde réel : Ils ont testé cinq mouvements réels, incluant l'essuyage d'un tableau blanc et le fait de s'appuyer sur le dossier d'une chaise.
    • Lorsqu'on lui a dit d'essuyer, la main du robot a pressé assez fort pour laisser une marque visible sur le tableau.
    • Lorsqu'on lui a dit de planer, la main s'est déplacée au même endroit mais n'a laissé aucune marque.
    • Lorsqu'on lui a dit de s'appuyer, le robot a posé son poids sur le dossier de la chaise. Lorsqu'on lui a dit de ne pas s'appuyer, il est resté droit, en équilibre par lui-même.

Les résultats sont impressionnants. Dans le monde réel, le robot a réussi à suivre la commande de contact environ 90 % à 100 % du temps pour la plupart des tâches (par exemple, 9 fois sur 10 pour s'appuyer sur un dossier, et 5 fois sur 5 pour essuyer le tableau).

Ce qu'il ne peut pas faire (encore)

L'article est très clair sur ce qu'il n'est pas.

  • Ce n'est pas un robot « universel » capable de faire n'importe quelle tâche avec un seul cerveau. Les chercheurs ont entraîné un « cerveau » (politique de contrôle) distinct pour chaque mouvement spécifique. Ils n'ont pas encore trouvé comment faire en sorte qu'un seul robot puisse faire toutes ces choses à la fois.
  • Il repose sur des vidéos de haute qualité d'humains interagissant avec des objets. Ils n'ont pas utilisé de vidéos aléatoires d'Internet ; ils ont utilisé un ensemble de données spécifique appelé HUMOTO.
  • Ils n'ont pas utilisé de capteurs de toucher spéciaux sur la peau du robot. Au lieu de cela, le robot a appris s'il touchait quelque chose simplement en ressentant ses propres muscles et articulations (proprioception). Ils ont prouvé que cela fonctionne en montrant que si on demandait à un programme informatique simple de deviner « Est-ce que le robot touche ? » en se basant sur les sensations internes du robot, il avait raison presque tout le temps (avec des scores F1 d'environ 0,90 à 0,99 pour la plupart des tâches).

L'essentiel à retenir

L'article suggère que si vous voulez qu'un robot accomplisse des tâches physiques utiles, vous devez arrêter de simplement lui dire où aller. Vous devez explicitement lui dire s'il doit toucher. En brisant le lien entre « position » et « contact » pendant l'entraînement, ils ont appris au robot à écouter un simple interrupteur. C'est une étape vers des robots qui ne font pas seulement semblant de faire une tâche, mais qui accomplissent réellement la tâche en établissant le contact physique approprié.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →