← Derniers articles
🤖 machine learning

Zero-shot Human Pose Estimation using Diffusion-based Inverse solvers

Ce papier présente InPose, une méthode d'estimation de la pose humaine en zéro-shot qui formule la tâche comme un problème inverse en exploitant un modèle de diffusion préentraîné conditionné par des mesures de rotation et guidé par un terme de vraisemblance dérivé de données de localisation éparses afin d'assurer une généralisation robuste à travers des utilisateurs de tailles corporelles variées.

Auteurs originaux : Sahil Bhandary Karnoor, Romit Roy Choudhury

Publié 2026-05-13
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Sahil Bhandary Karnoor, Romit Roy Choudhury

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de deviner ce qu'une personne fait avec tout son corps (danser, courir, faire des signes) en regardant uniquement trois minuscules capteurs fixés à sa tête et à ses poignets. C'est le problème de l'Estimation de la Pose Humaine.

L'article présente une nouvelle méthode appelée InPose qui résout un gros casse-tête dans ce domaine : les Différences de Morphologie.

Le Problème : Le Piège du « Taille Unique pour Personne »

Imaginez un robot très intelligent qui a appris à deviner les mouvements corporels en observant une personne spécifique, appelons-le « Grand Bob ». Le robot a appris que lorsque le capteur du poignet de Bob bouge ainsi, son coude se trouve .

Maintenant, imaginez que vous essayiez d'utiliser ce même robot pour deviner les mouvements de « Petite Sally ». Même si Sally bouge son poignet exactement comme Bob l'a fait, son coude se trouve à un endroit complètement différent car ses bras sont plus courts. Le robot, entraîné uniquement sur Bob, se trompe et fait de mauvaises prédictions. C'est comme essayer de porter un costume taillé pour un géant sur un enfant ; les manches sont trop longues et le pantalon trop court.

Les méthodes précédentes tentaient de résoudre ce problème en entraînant le robot sur de nombreuses morphologies différentes, mais cela rendait le robot incroyablement complexe et ne couvrait toujours pas toutes les formes humaines possibles (comme quelqu'un ayant des jambes anormalement longues ou un torse très court).

La Solution : InPose (Le Détective « Indépendant de l'Échelle »)

Les auteurs de cet article, Sahil Bhandary Karnoor et Romit Roy Choudhury, ont trouvé une astuce ingénieuse. Ils ont réalisé que la pose humaine peut être divisée en deux parties :

  1. La Pose « Indépendante de l'Échelle » : C'est la forme du mouvement (par exemple, « les bras sont pliés à 90 degrés »). Cela reste le même que vous soyez un géant ou un nain.
  2. La Pose « Dépendante de l'Échelle » : C'est l'emplacement réel des articulations dans l'espace, qui dépend entièrement de la longueur de vos os.

InPose fonctionne comme un détective en deux étapes :

Étape 1 : L'« Imagination » (Le Prior de Diffusion)

D'abord, le système utilise une IA pré-entraînée (un « Modèle de Diffusion ») qui a appris les règles du mouvement humain. Cette IA est comme un artiste qui sait comment les humains bougent généralement. Elle examine les données de rotation provenant des trois capteurs (comment la tête et les poignets tournent) et imagine un humain « parfait » effectuant ce mouvement.

  • Point Crucial : Comme elle ne regarde que la rotation (les angles), elle ne se soucie pas de savoir si la personne est grande ou petite. Elle voit simplement les « pas de danse ».

Étape 2 : Le « Contrôle de Réalité » (Le Résolveur Inverse)

Maintenant, le système examine les données de position (où se trouvent réellement les capteurs dans l'espace). Il se demande : « D'accord, j'ai ce mouvement de danse imaginé. Est-ce qu'il correspond aux positions réelles des capteurs pour cette personne spécifique ? »

Voici la magie : Au lieu de réentraîner l'IA pour chaque nouvelle personne, InPose utilise les mathématiques pour étirer ou rétrécir la danse « parfaite » imaginée afin qu'elle s'adapte aux longueurs d'os spécifiques de la personne. Il traite le problème comme un puzzle : « Si les capteurs sont ici, et que les os ont cette longueur, que doit faire le reste du corps ? »

Ceci est appelé un Problème Inverse. Au lieu de demander « Si je bouge mon bras, où va le capteur ? » (Direct), il demande « Le capteur est ici, donc où doit se trouver mon bras ? » (Inverse).

Le Super-Pouvoir « Zéro Coup »

Le terme « Zéro Coup » dans le titre signifie que le système peut deviner la pose d'une nouvelle personne qu'il n'a jamais vue auparavant, sans avoir besoin d'être réentraîné ou affiné.

  • Ancienne Méthode : Entraîner sur Bob, entraîner sur Sally, entraîner sur un basketteur, entraîner sur une gymnaste. Si une nouvelle personne entre avec des proportions étranges, le système échoue.
  • Méthode InPose : Entraîner sur les règles du mouvement (en utilisant la rotation). Quand une nouvelle personne entre, il suffit de fournir ses longueurs d'os et les données des capteurs. Les mathématiques font le reste. C'est comme avoir un traducteur universel qui fonctionne pour n'importe quelle langue sans avoir besoin d'un dictionnaire pour chaque dialecte spécifique.

Comment il Gère le Bruit

L'article montre également qu'InPose est très bon pour ignorer le « bruit » ou les erreurs des capteurs.

  • Analogie : Imaginez essayer d'entendre une chanson à la radio avec des parasites.
    • Les anciennes méthodes tentent d'amplifier le signal, mais les parasites (bruit des capteurs) rendent la musique inintelligible.
    • InPose écoute la « mélodie » (la rotation/prior) qui est claire, et n'utilise les « paroles » (les données de position) que pour vérifier si la mélodie a du sens. Si les données de position sont bruyantes, la mélodie (la connaissance de l'IA sur le mouvement humain) maintient la précision de la prédiction.

Le Bémol (Limites)

L'article est honnête sur les endroits où InPose éprouve des difficultés :

  1. Le Problème des « Jambes » : Comme les capteurs sont uniquement sur la tête et les poignets, le système doit deviner ce que font les jambes en se basant sur le haut du corps. Si la personne saute ou si le sol est irrégulier, le système se trompe parfois sur les jambes. C'est comme essayer de deviner la démarche d'une personne en regardant uniquement ses mains ; vous pouvez deviner le rythme, mais vous risquez de manquer une étape spécifique.
  2. Performance par Défaut : Si vous testez InPose sur une personne qui ressemble exactement à la personne « moyenne » sur laquelle l'IA a été entraînée, elle est en fait légèrement pire que les anciennes méthodes. Les anciennes méthodes sont comme un tailleur qui connaît vos mesures exactes ; InPose est comme un maître tailleur qui connaît les principes de la couture et peut deviner votre taille parfaitement, mais pourrait manquer un tout petit détail si vous êtes exactement moyen.

Résumé

InPose est une nouvelle façon de suivre le mouvement humain en utilisant seulement trois capteurs. Il sépare « comment vous bougez » de « quelle est votre taille ». En utilisant une IA intelligente pour deviner le style de mouvement et une astuce mathématique pour ajuster la taille du corps, il peut suivre n'importe qui, n'importe où, instantanément, sans avoir besoin d'apprendre d'abord sa morphologie spécifique. C'est une solution « ajustement universel » pour le suivi du mouvement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →