American Sign Language Recognition Using Mediapipe and Deep Learning: A Real-Time Approach
Dit artikel presenteert een real-time, lichtgewicht systeem voor het herkennen van Amerikaanse Gebarentaal dat gebruikmaakt van Google MediaPipe voor handlandmarkdetectie en een diep neuraal netwerk om een nauwkeurigheid van 98,49% te bereiken bij het classificeren van statische ASL-alfabetgebaren op consumentenapparatuur.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Voor veel mensen is het vermogen om te communiceren vanzelfsprekend, een naadloze stroom van geluid en betekenis. Maar voor doven of slechthorenden presenteert de wereld zich vaak als een muur van stilte, vooral bij interactie met mensen die de gebarentaal niet kennen. Amerikaanse Gebarentaal, of ASL, is een rijke, visuele taal waarbij de betekenis wordt gedragen door de vorm van de hand, de beweging van de vingers en de positie van de handpalm. Decennialang hebben onderzoekers geprobeerd machines te bouwen die een persoon kunnen zien gebaren en die gebaren kunnen vertalen naar woorden, in de hoop die kloof te overbruggen. Vroege pogingen vereisten vaak dure, logge apparatuur zoals speciale handschoenen met sensoren of zware camera's die diepte konden zien, wat de technologie onpraktisch maakte voor dagelijks gebruik. Het doel is altijd geweest om een manier te vinden om deze vertaling te laten plaatsvinden met slechts een eenvoudige camera, zoals de camera die in een laptop of telefoon is ingebouwd, zodat de technologie door iedereen, overal gebruikt kan worden.
Een recente studie door Amna Atiq van de University of Engineering and Technology in Lahore zet een belangrijke stap richting dat doel. De onderzoeker ontwikkelde een systeem dat de statische letters van het Amerikaanse gebarentaalalfabet in realtime kan herkennen, met niets meer dan een standaard webcam en een computer. In plaats van te vertrouwen op complexe hardware, gebruikt het systeem een softwaretool genaamd MediaPipe om te fungeren als een digitaal oog. Deze tool scant de videofeed en vindt eenentwintig specifieke punten op een menselijke hand, zoals de punt van de duim, de knokkels en de pols. Het volgt deze punten terwijl ze bewegen en creëert zo een digitaal skelet van de hand dat in een driedimensionale ruimte bestaat. Door zich te concentreren op de positie van deze punten in plaats van op de ruwe pixels van het beeld, kan het systeem afleidingen zoals rommel op de achtergrond of veranderingen in de verlichting negeren, en zich alleen richten op de vorm van de hand zelf.
Zodra de software de hand heeft in kaart gebracht, stuurt deze de informatie naar een klein, efficiënt computerprogramma dat is ontworpen om patronen te leren. Dit programma, een type kunstmatige intelligentie bekend als een diep neuraal netwerk, werd getraind op een collectie van meer dan zes duizend voorbeelden van handgebaren. Elk voorbeeld toonde de hand waarbij een letter van A tot Z werd gevormd. Het programma leerde de specifieke rangschikking van de eenentwintig handpunten te associëren met de juiste letter. Om te testen hoe goed dit werkte, splitste de onderzoeker de data: het grootste deel werd gebruikt om het programma te onderwijzen en een apart deel werd behouden om de kennis te testen. De resultaten waren opmerkelijk: het systeem identificeerde het handgebaar in bijna negentigennegentig procent van de testgevallen correct. Het was in staat dit snel genoeg te doen om een live videofeed bij te houden, waarbij elk frame in ongeveer drieëttig milliseconden werd verwerd, wat snel genoeg is om voor een menselijk oog als onmiddellijk te worden ervaren.
De studie keek ook nauwgezet naar de punten waarop het systeem zou kunnen struikelen. Hoewel het uitstekend presteerde op de meeste letters, verwarde het af en toe letters die erg op elkaar lijken, zoals M, N en T. Dit is een natuurlijke uitdaging, aangezien deze gebaren subtiele verschillen in vingerpositionering inhouden die zelfs voor mensen moeilijk te onderscheiden zijn als het zicht niet perfect is. Ondanks deze kleine haperingen bewees het systeem dat een hoge nauwkeurigheid geen massieve supercomputers of gespecialiseerde sensoren vereist. De volledige opstelling draaide soepel op een standaard laptop met acht gigabyte aan geheugen, wat aantoont dat krachtige ondersteunende technologie lichtgewicht en toegankelijk kan zijn. De onderzoeker merkte op dat het systeem het beste werkt met statische gebaren, wat betekent dat het gaat om losse letters die op hun plaats worden gehouden, in plaats van de vloeiende, continue beweging van volledige zinnen, wat een complexere uitdaging blijft voor de toekomst.
Wat dit werk bijzonder betekenisvol maakt, is de focus op praktische bruikbaarheid. Door de noodzaak van handschoenen, dieptecamera's of hoogwaardige grafische kaarten weg te strippen, laat het onderzoek zien dat een hulpmiddel in staat is om gebarentaal te vertalen binnenkort beschikbaar kan zijn voor iedereen met een computer en een internetverbinding. Het systeem herkent niet alleen vormen; het opent een deur naar communicatie voor mensen die anders geïsoleerd zouden kunnen zijn. De onderzoeker is van plan om op dit fundament voort te bouwoorden door het systeem te leren de stroom van dynamische gebaren te begrijpen en door de software aan te passen zodat deze op mobiele apparaten kan draaien. Voor nu staat de prestatie als een duidelijke demonstratie dat we, met de juiste combinatie van software en eenvoudige hardware, de barrières die de horende en de dove scheiden kunnen beginnen af te breken, en een standaard webcam kunnen transformeren tot een brug voor menselijke verbinding.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.