Research on table tennis motion recognition under limb occlusion
Cet article présente un ensemble de données de mouvement de tennis de table fiable et propose un modèle de réseau de neurones convolutifs sur graphe spatio-temporel qui prédit efficacement les positions des articulations occultées afin d'améliorer la précision de la reconnaissance du mouvement en cas d'occlusion des membres.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de haut niveau du tennis de table de compétition, une décision prise en une fraction de seconde détermine souvent l'issue d'un match. Les athlètes doivent constamment scanner le corps de leur adversaire, déchiffrant les indices subtils dans le mouvement d'un bras ou le transfert de poids pour prédire la trajectoire de la balle. Cependant, le jeu est rarement pratiqué avec une vue claire et ininterrompue. Le filet, la table et le corps même de l'adversaire bloquent fréquemment la ligne de visée, cachant les mouvements mêmes qui détiennent le secret du coup suivant. Ce phénomène, connu sous le nom d'occlusion, crée un angle mort où des informations critiques disparaissent. Depuis des décennies, des chercheurs tentent d'apprendre aux ordinateurs à voir à travers ces lacunes, en utilisant l'intelligence artificielle pour combler les pièces manquantes d'une image en mouvement. Le défi consiste à apprendre à une machine non seulement à reconnaître un motif lorsqu'il est complet, mais à comprendre l'histoire entière même lorsque certaines parties manquent, en s'appuyant sur la logique de la manière dont les corps humains bougent ensemble au fil du temps.
Une équipe de chercheurs de l'Université du Sport de Shandong et de l'Université du Sport de Shanghai s'est donné pour mission de résoudre ce casse-tête spécifique dans le contexte du tennis de table. Ils ont commencé par capturer les mouvements précis de trente joueurs professionnels à l'aide d'un système spécialisé de caméras infrarouges qui suivaient la position de marqueurs réfléchissants placés sur le corps et la raquette des athlètes. Ce processus a généré une base de données massive, enregistrant l'emplacement exact de quatorze articulations clés du corps pour chaque image du mouvement d'un joueur. Avec cette archive numérique en main, l'équipe a créé une expérience contrôlée pour simuler le chaos d'un véritable match. Ils ont utilisé des logiciels informatiques pour construire des animations de silhouettes (stick-figures) des joueurs, puis ont systématiquement effacé différentes parties de ces silhouettes pour imiter la façon dont un filet ou un corps pourrait cacher un membre pendant un jeu. Ils ont créé des scénarios où le bras gauche était caché, où les jambes étaient invisibles, où tout le torse était obscurci, et même où seule la trajectoire de la raquette restait visible.
Trente autres joueurs professionnels ont ensuite été invités à regarder ces animations incomplètes et à identifier le type de coup spécifique exécuté, tel qu'un coup droit offensif ou un revers de drive. Les résultats ont offert une carte claire de ce qui est réellement essentiel. Lorsque le corps entier était visible, les joueurs identifiaient les mouvements avec une précision quasi parfaite. Lorsque le bras gauche était caché, leur performance chutait à peine, suggérant que le bras non dominant est moins critique pour lire l'intention de l'adversaire. Cependant, lorsque la trajectoire de la raquette était la seule chose visible, la précision diminuait considérablement, bien qu'elle restât suffisamment élevée pour prouver que le chemin de la balle et de la raquette revêt un poids immense. La découverte la plus révélatrice survint lorsque les chercheurs ont supprimé le bas du corps ou le torse entier ; même avec les membres inférieurs obscurcis, la précision de la reconnaissance était de 91,4 %, et avec le torse complètement obscurci, elle restait à 96,2 %, indiquant que si le bas du corps fournit le contexte, le haut du corps et la trajectoire de la raquette seuls sont suffisants pour une identification de mouvement hautement précise.
Ayant établi ce que les humains ont besoin de voir, les chercheurs se sont tournés vers l'intelligence artificielle pour voir si un ordinateur pouvait accomplir le même travail, mais avec une nuance. Ils ont construit un réseau neuronal spécialisé, un type de programme informatique conçu pour apprendre des modèles, afin de servir de restaurateur numérique. L'objectif était de fournir au système une animation avec des articulations manquantes et de lui faire calculer exactement où ces parties cachées devraient se trouver. Le système a appris la relation entre les os visibles et les os invisibles, comprenant que si l'épaule droite bouge d'une certaine manière, le bras gauche doit bouger d'une façon spécifique et coordonnée. Lors des tests, l'ordinateur a réussi à reconstruire les membres manquants, comblant les lacunes avec un niveau de précision qui correspondait aux jugements des entraîneurs humains. Les mouvements reconstruits étaient si précis que lorsque des experts ont évalué les animations incomplètes originales et les versions complétées par l'ordinateur, les scores étaient presque identiques, la version de l'ordinateur restaurant le mouvement à un état qui paraissait complet et naturel.
L'étude conclut que si la raquette et le bras dominant sont les sources primaires d'information pour prédire un coup de tennis de table, le reste du corps fournit le contexte nécessaire pour rendre cette prédiction fiable. La recherche démontre qu'en comprenant les connexions spatio-temporelles entre les articulations — comment elles bougent les unes par rapport aux autres à travers le temps — il est possible d'inférer mathématiquement la position d'un membre caché avec une grande confiance. Ce travail ne propose pas seulement un moyen d'améliorer la technologie de suivi de mouvement ; il offre une compréhension plus profonde de la manière dont les athlètes eux-mêmes traitent l'information visuelle sous pression. Il suggère que même lorsque la vue est obstruée, le cerveau et la machine peuvent tous deux s'appuyer sur les indices visibles restants pour reconstruire la réalité complète du mouvement, transformant une vue fragmentée en une prédiction claire.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.