← Derniers articles
💻 computer science

A Residual Transformer Framework for Biomechanics-Aware Yoga Posture Recognition and Feedback

Cet article propose le Residual Biomechanical Transformer Network (RBTNet), un cadre d'apprentissage profond qui combine la détection de points clés YOLOv8m-Pose avec une analyse temporelle basée sur les Transformers pour atteindre une précision de 98 % dans la classification de huit postures de yoga et la génération de retours correctifs basés sur les écarts d'angles articulaires biomécaniques sans nécessiter de données spécifiques à l'utilisateur.

Auteurs originaux : Mrinal Kanti Nath, Tapan Chowdhury, Nilay Dhar, Hiranmoy Sarkar, Debanjan Bunia, Arman Munshi

Publié 2026-09-09
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mrinal Kanti Nath, Tapan Chowdhury, Nilay Dhar, Hiranmoy Sarkar, Debanjan Bunia, Arman Munshi

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Pendant des siècles, la pratique du yoga a été un pont entre la discipline physique et la clarté mentale, s'appuyant sur l'alignement précis du corps pour en débloquer les bienfaits. Pourtant, pour des millions de pratiquants apprenant de manière isolée ou via des écrans numériques, le chemin vers une forme correcte est souvent pavé d'incertitudes. Sans un instructeur compétent pour repérer un genou mal aligné ou une colonne vertébrale inclinée, les mouvements mêmes destinés à guérir peuvent entraîner des tensions ou des blessures. Le défi consiste à traduire le langage subtil et fluide du corps humain en quelque chose qu'une machine puisse comprendre. C'est le domaine de la vision par ordinateur, un domaine où les caméras et les algorithmes travaillent ensemble pour voir et interpréter le mouvement. Bien que les systèmes modernes puissent déjà identifier l'emplacement des articulations d'une personne dans une vidéo, ils ont historiquement eu du mal à saisir l'histoire du mouvement à travers le temps ou à offrir des conseils spécifiques et sûrs sur la façon de corriger une erreur. Ils voient souvent un instantané unique d'une pose plutôt que le flux continu d'une pratique, et ils manquent de la capacité de distinguer un étirement délibéré d'une erreur dangereuse.

Une équipe de chercheurs de Techno Main Salt Lake en Inde a développé un nouveau système conçu pour résoudre ces problèmes spécifiques, créant un assistant numérique qui ne se contente pas de reconnaître les postures de yoga, mais comprend la biomécanique qui les sous-tend. Leur travail, intitulé Residual Biomechanical Transformer Network, dépasse la simple reconnaissance d'images pour construire un modèle qui observe une personne bouger, analyse les angles de ses articulations et fournit des instructions immédiates et claires sur la façon de corriger sa forme. Le système a été testé sur huit postures de yoga courantes, notamment le Guerrier, l'Arbre et le Cobra, et il a atteint un niveau de précision remarquable, identifiant correctement la posture dans 98 pour cent des cas. Plus important encore, il le fait sans avoir besoin d'une base de données des détails physiques personnels de l'utilisateur, tels que son âge ou sa flexibilité, ce qui en fait un outil universel pour quiconque cherche à pratiquer en toute sécurité.

Le voyage commence avec la caméra, qui agit comme les yeux du système. Au lieu d'essayer d'analyser les détails complexes des vêtements d'une personne ou l'arrière-plan de la pièce, le logiciel localise d'abord dix-sept points spécifiques sur le squelette humain, tels que les épaules, les coudes, les hanches et les genoux. Ce processus, appelé estimation de pose, élimine tout ce qui est inutile pour se concentrer uniquement sur la structure du corps. Cependant, les chercheurs ont réalisé que savoir simplement où se trouvent ces points dans une seule image ne suffit pas. Le yoga est une activité dynamique ; une pose est souvent le résultat d'un mouvement, et la transition vers une position peut ressembler de manière trompeuse à d'autres mouvements. Pour capturer cela, le système ne regarde pas une image à la fois. Au lieu de cela, il observe une séquence de trente images, créant une courte fenêtre de temps qui lui permet de comprendre le flux du mouvement. Cette conscience temporelle aide le système à distinguer une pose tenue de manière stable d'une pose qui n'est qu'un passage à travers une forme similaire lors d'une transition.

Une fois que le système a capturé cette séquence de mouvements squelettiques, il traduit les positions brutes des articulations en un langage de géométrie indépendant de la taille de la personne ou de sa distance par rapport à la caméra. Il calcule les angles entre les articulations, les longueurs relatives des membres et les proportions du corps, normalisant ces mesures afin qu'une personne grande et une personne petite effectuant la même pose paraissent identiques à l'algorithme. Cela crée une description compacte à 74 dimensions de la configuration du corps qui se concentre entièrement sur la biomécanique de la pose. Le système injecte ensuite cette description dans un réseau neuronal spécialisé, un type d'intelligence artificielle conçu pour trouver des modèles dans les séquences. Ce réseau prête une attention particulière aux moments les plus critiques au sein de la séquence, apprenant à reconnaître les caractéristiques stables et définissantes de chaque posture de yoga tout en ignorant les moments éphémères de transition.

La véritable innovation de ce cadre réside dans la manière dont il gère les erreurs. De nombreux systèmes existants pourraient simplement deviner la pose correcte et s'arrêter là, ou pourraient s'appuyer sur des règles rigides et préprogrammées qui échouent lorsque le corps de l'utilisateur est légèrement différent. Cette nouvelle approche combine la puissance d'apprentissage du réseau neuronal avec un ensemble de règles anatomiques claires. Une fois que le système identifie une pose, il vérifie immédiatement les angles des articulations de l'utilisateur par rapport aux plages idéales pour cette posture spécifique. Si un genou est trop plié ou si une épaule est trop haute, le système ne se contente pas de signaler une erreur ; il génère une instruction spécifique et lisible par l'homme. Par exemple, si un utilisateur tente la pose du Guerrier mais que son genou avant est droit au lieu d'être plié, le système indiquera explicitement que le genou devrait être plié à environ quatre-vingt-dix degrés. Ce retour est généré sur la base de la déviation mesurée par rapport à l'angle idéal, garantissant que le conseil est toujours pertinent par rapport à l'erreur spécifique commise.

Les chercheurs ont testé leur système sur un ensemble de données contenant des milliers d'images de personnes effectuant huit poses de yoga différentes. Les résultats étaient frappants. Le système a correctement identifié la posture dans 98 pour cent des cas de test, un niveau de précision qui suggère qu'il a maîtrisé les nuances visuelles et temporelles de ces mouvements. Il a particulièrement bien performé sur des poses distinctes comme la Chaise et l'Arbre, où le corps forme une forme claire et unique. Même dans des scénarios plus difficiles où les poses partagent des positions de départ ou d'arrivée similaires, comme la transition entre le Guerrier et la posture du Chien, le système a réussi à les différencier avec une grande précision. Lorsque le système commettait une erreur, c'était presque toujours une confusion entre deux poses qui se ressemblent beaucoup lors d'une phase spécifique du mouvement, plutôt qu'un échec total de reconnaissance de la structure du corps.

Au-delà des chiffres, le système a démontré sa capacité à fonctionner en temps réel, traitant la vidéo en direct d'une webcam avec une vitesse permettant un retour immédiat. Lors de tests en direct, le système a identifié avec succès les poses et a mis en évidence les articulations spécifiques qui étaient mal alignées, offrant des corrections qui correspondaient aux plages biomécaniques idéales. Par exemple, lorsqu'un utilisateur maintenait une pose avec un angle de genou trop large, le système fournissait une instruction directe pour ajuster le membre, imitant les conseils qu'un instructeur humain donnerait. Cette capacité à fournir un feedback actionnable et spécifique à la pose, sans exiger que l'utilisateur saisisse ses statistiques physiques personnelles, rend le système hautement adaptable. Il n'a pas besoin de savoir si l'utilisateur est jeune ou âgé, souple ou raide ; il mesure simplement la géométrie du mouvement par rapport aux normes universelles de la pose.

Le succès de ce cadre suggère une nouvelle direction pour la façon dont la technologie peut soutenir le bien-être physique. En s'éloignant des vérifications statiques basées sur des règles pour aller vers un système qui comprend le mouvement comme un événement temporel continu, les chercheurs ont créé un outil qui est à la fois intelligent et interprétable. Le système ne fonctionne pas comme une boîte noire ; son retour est directement traçable aux angles des articulations, rendant le conseil transparent et digne de confiance. Bien que l'étude actuelle se soit concentrée sur huit poses spécifiques, la méthode sous-jacente est conçue pour être évolutive, capable d'apprendre de nouveaux mouvements à mesure que davantage de données deviennent disponibles. Ce travail prouve qu'avec la bonne combinaison de vision par ordinateur, d'ingénierie biomécanique et d'apprentissage profond, les machines peuvent apprendre à voir le corps humain non pas comme une collection de pixels, mais comme une structure dynamique qui peut être guidée vers un mouvement plus sûr et plus efficace.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →