American Sign Language Recognition Using Mediapipe and Deep Learning: A Real-Time Approach
Cet article présente un système de reconnaissance de la langue des signes américaine en temps réel et léger qui utilise Google MediaPipe pour la détection des points de repère de la main et un réseau de neurones profonds pour atteindre une précision de 98,49 % dans la classification des gestes statiques de l'alphabet ASL sur des appareils grand public.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Pour beaucoup de gens, la capacité de communiquer est un acquis, un flux fluide de sons et de sens. Mais pour les personnes sourdes ou malentendantes, le monde présente souvent un mur de silence, surtout lors d'interactions avec des personnes qui ne connaissent pas la langue des signes. L'américain des signes, ou ASL, est une langue visuelle riche où le sens est porté par la forme de la main, le mouvement des doigts et la position de la paume. Pendant des décées, des chercheurs ont tenté de construire des machines capables d'observer une personne qui signe et de traduire ces gestes en mots, dans l'espoir de combler ce fossé. Les premières tentatives nécessitaient souvent des équipements coûteux et encombrants, comme des gants spéciaux dotés de capteurs ou des caméras lourdes capables de percevoir la profondeur, rendant la technologie impraticable pour un usage quotidien. L'objectif a toujours été de trouver un moyen de faire en sorte que cette traduction se produise en utilisant uniquement une caméra simple, comme celle intégrée à un ordinateur portable ou un téléphone, afin que la technologie puisse être utilisée par n'importe qui, n'importe où.
Une étude récente menée par Amna Atiq, de l'Université de technologie et d'ingénierie de Lahore, franchit une étape significative vers cet objectif. La chercheuse a développé un système capable de reconnaître les lettres statiques de l'alphabet de l'américain des signes en temps réel, en utilisant rien de plus qu'une webcam standard et un ordinateur. Au lieu de s'appuyer sur un matériel complexe, le système utilise un outil logiciel appelé MediaPipe pour agir comme un œil numérique. Cet outil scanne le flux vidéo et trouve vingt et un points spécifiques sur une main humaine, tels que le bout du pouce, les articulations et le poignet. Il suit ces points lorsqu'ils se déplacent, créant un squelette numérique de la main qui existe dans un espace tridimensionnel. En se concentrant sur la position de ces points plutôt que sur les pixels bruts de l'image, le système peut ignorer les distractions comme l'encombrement de l'arrière-plan ou les changements de luminosité, se concentrant uniquement sur la forme de la main elle-même.
Une fois que le logiciel a cartographié la main, il envoie cette information à un petit programme informatique efficace conçu pour apprendre des modèles. Ce programme, un type d'intelligence artificielle connu sous le nom de réseau de neurones profonds, a été entraîné sur une collection de plus de six mille exemples de gestes de la main. Chaque exemple montrait la main formant une lettre de A à Z. Le programme a appris à associer l'arrangement spécifique de ces vingt et un points de la main à la lettre correspondante. Pour tester l'efficacité de ce processus, la chercheuse a divisé les données, utilisant la majeure partie pour enseigner au programme et conservant une partie distincte pour tester ses connaissances. Les résultats ont été frappants : le système a identifié correctement le geste de la main dans près de quatre-vingt-dix-neuf pour cent des cas de test. Il a été capable de le faire assez rapidement pour suivre un flux vidéo en direct, traitant chaque image en environ trente-deux millisecondes, ce qui est assez rapide pour paraître instantané pour un observateur humain.
L'étude a également examiné de près les points où le système pourrait trébucher. Bien qu'il ait été exceptionnellement performant sur la plupart des lettres, il a parfois confondu des lettres qui se ressemblent beaucoup, telles que M, N et T. C'est un défi naturel, car ces signes impliquent des différences subtiles de positionnement des doigts qui sont difficiles à distinguer, même pour les humains, si la vue n'est pas parfaite. Malgré ces légers accrocs, le système a prouvé qu'une grande précision ne nécessite pas de supercalculateurs massifs ou de capteurs spécialisés. Toute l'installation fonctionnait sans encombre sur un ordinateur portable standard doté de huit gigaoctets de mémoire, démontrant que la technologie d'assistance puissante peut être légère et accessible. La chercheuse a noté que le système fonctionne mieux avec des gestes statiques, c'est-à-dire des lettres uniques maintenues en place, plutôt qu'avec le mouvement fluide et continu de phrases complètes, ce qui demeure un défi plus complexe pour l'avenir.
Ce qui rend ce travail particulièrement significatif est son accent mis sur la praticité. En supprimant le besoin de gants, de caméras de profondeur ou de cartes graphiques haut de gamme, la recherche montre qu'un outil capable de traduire la langue des signes pourrait bientôt être disponible pour toute personne possédant un ordinateur et une connexion Internet. Le système ne se contente pas de reconnaître des formes ; il ouvre une porte à la communication pour des personnes qui pourraient autrement être isolées. La chercheuse prévoit de bâtir sur cette base en apprenant au système à comprendre le flux des signes dynamiques et en adaptant le logiciel pour qu'il fonctionne sur des appareils mobiles. Pour l'instant, cette réussite constitue une démonstration claire qu'avec la bonne combinaison de logiciels et de matériel simple, nous pouvons commencer à démanteler les barrières qui séparent les entendants et les sourds, transformant une webcam standard en un pont pour la connexion humaine.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.