← Derniers articles
💻 computer science

SocioGesture: Real-Time and Adaptive Social Gesture Perception for Human-Robot Interaction

L'article présente SocioGesture, un système de perception de gestes sociaux en temps réel et adaptatif pour l'interaction humain-robot qui utilise un modèle à double flux léger, entraîné avec une corruption sensible aux occlusions, afin d'obtenir une reconnaissance robuste et à faible latence sur des appareils de bord tout en élargissant continuellement son vocabulaire grâce à l'adaptation hors ligne.

Auteurs originaux : Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

Publié 2026-09-07
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots apprennent à se déplacer dans notre monde, mais pour interagir avec nous de manière naturelle, ils doivent faire plus que simplement suivre des ordres verbaux. Ils doivent comprendre le langage silencieux du mouvement humain : un signe de la main pour dire bonjour, une paume levée pour dire stop, ou un téléphone porté à l'oreille pour signaler « je suis occupé ». C'est le défi de l'interaction homme-robot, un domaine dédié à l'apprentissage de la lecture de ces indices sociaux par les machines. La difficulté réside dans la réalité désordonnée du monde réel. Contrairement à une vidéo visionnée dans un bureau calme, un robot voit les gens sous des angles mouvants, souvent avec des mains cachées derrière le corps ou perdues dans l'ombre. De plus, un robot ne peut pas se permettre de s'arrêter et de réfléchir trop longtemps ; si l'hésitation pour interpréter un geste est trop longue, l'interaction semble brisée et artificielle. L'objectif est de construire un système assez rapide pour suivre le rythme d'une conversation, assez intelligent pour gérer les informations manquantes, et capable d'apprendre de ses erreurs sans qu'un humain ait besoin de le reprogrammer à chaque fois.

Les chercheurs d'OpenMind ont développé un nouveau système appelé SocioGesture pour résoudre ce problème. Il s'agit d'un outil de perception en temps réel conçu spécifiquement pour les robots qui doivent reconnaître des gestes sociaux tout en se déplaçant et en travaillant. Le système fonctionne en observant le squelette d'une personne — la carte de ses articulations et de ses os — plutôt qu'en essayant d'analyser ses vêtements ou l'arrière-plan. Cette approche est choisie car un squelette reste reconnaissable même lorsque l'éclairage change ou que la personne porte des vêtements différents. Cependant, les chercheurs savaient que le suivi de squelette standard échoue souvent lorsqu'une main est occultée ou qu'un angle de caméra change. Pour y remédier, ils ont construit un modèle qui prête attention à la confiance de chaque articulation. Si la caméra du robot n'est pas sûre de l'emplacement d'une main, le système note cette incertitude plutôt que de deviner aveuglément. Il combine le mouvement large du corps avec les détails fins de la main, les fusionnant dans un calcul unique et ultra-rapide qui s'exécute directement sur l'ordinateur embarqué du robot.

L'innovation centrale de SocioGesture est sa façon de gérer les lacunes inévitables dans les données. Dans de nombreux systèmes précédents, si une articulation clé comme le poignet manquait, toute la tentative de reconnaissance échouait. Ce nouveau système est entraîné pour anticiper ces lacunes. Les chercheurs ont délibérément « corrompu » leurs données d'entraînement en cachant des mains et des bras dans les simulations informatiques, forçant le modèle à apprendre comment reconnaître un geste même lorsque des parties du squelette sont invisibles. Cet entraînement a lieu avant que le robot ne quitte le laboratoire, de sorte que le robot n'ait pas besoin de puissance de calcul supplémentaire pour être robuste. Lorsque le robot est sur le terrain, il prend des décisions basées sur ce qu'il voit. S'il est très confiant quant à un geste, il agit immédiatement. S'il est incertain, il ne devine pas ; au lieu de cela, il réserve ce moment d'interaction pour une revue ultérieure. Cela crée une boucle de sécurité où le robot évite de commettre des erreurs dangereuses, comme s'approcher de quelqu'un qui essaie de l'arrêter, tout en collectant des données pour devenir plus intelligent.

Le système a été testé dans divers environnements intérieurs et extérieurs avec de vraies personnes. Les chercheurs ont collecté un ensemble de données de sept gestes sociaux courants, incluant le fait de faire signe de la main pour inviter un robot à s'approcher, lever la main pour l'arrêter, ou faire semblant d'être au téléphone pour signaler une indisponibilité. Ils ont également inclus un geste « distracteur », comme se gratter la tête, pour s'assurer que le robot ne le confonde pas avec un appel téléphonique. Lors de tests sur des personnes que le robot n'avait jamais vues auparavant, le système a correctement identifié les gestes dans la quasi-totalité des cas, même lorsque les mains étaient partiellement cachées. Dans un test spécifique où les mains étaient complètement masquées des données, la précision du système est passée d'un faible 31 % à un solide 85 %, prouvant que la méthode d'entraînement fonctionnait. Le système a également été assez rapide pour suivre une caméra vidéo standard, traitant une image complète en seulement 25 millisecondes sur un ordinateur monté sur le robot, ce qui est assez rapide pour paraître instantané pour un observateur humain.

La découverte la plus significative est peut-être la capacité du système à apprendre après son déploiement. Les chercheurs ont mis en place un processus où le robot signale les moments pour lesquels il est incertain et envoie ces clips vidéo vers un ordinateur plus puissant dans le cloud. Cet ordinateur puissant étiquette le geste, et le robot utilise cette nouvelle information pour mettre à jour son propre cerveau. Dans un test où le robot a appris trois nouveaux gestes — donner un pouce levé, une poignée de main et un salut — il a réussi à les apprendre sans oublier les sept originaux. Le système a maintenu sa haute précision sur les anciens gestes tout en identant correctement les nouveaux environ deux tiers du temps. Cela démontre une voie d'avenir où les robots peuvent élargir leur vocabulaire de signaux sociaux au fil du temps, s'adaptant à de nouvelles situations sans avoir besoin d'être arrêtés et réentraînés de zéro.

Les chercheurs ont également testé le système sur un robot réel, une machine humanoïde nommée Unitree G1, interagissant avec cinq nouvelles personnes qui n'avaient jamais fait partie des données d'entraînement. En 150 essais, le robot a correctement reconnu le geste 97 % du temps. Lorsque le robot décidait d'agir, il choisissait le comportement correct — comme s'approcher ou s'arrêter — 98 % du temps. Les rares fois où il n'a pas agi, ce n'était pas parce qu'il avait fait une erreur, mais parce qu'il faisait preuve de prudence ; il choisissait d'attendre plutôt que de risquer un mauvais mouvement. Cette approche conservatrice est exactement ce que les concepteurs souhaitaient pour un robot dans un espace public. L'étude suggère qu'en combinant un modèle léger et rapide, une stratégie axée sur la sécurité et une boucle d'apprentissage hors ligne, nous pouvons construire des robots qui sont non seulement efficaces, mais aussi socialement conscients et capables de s'adapter à la nature imprévisible de l'interaction humaine.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →