American Sign Language Recognition Using Mediapipe and Deep Learning: A Real-Time Approach
Dieses Paper präsentiert ein Echtzeit-, leichtgewichtiges American Sign Language Erkennungssystem, das Google MediaPipe zur Hand-Landmarken-Erkennung und ein tiefes neuronales Netzwerk nutzt, um eine Genauigkeit von 98,49 % bei der Klassifizierung statischer ASL-Alphabet-Gesten auf handelsüblichen Geräten zu erreichen.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Für viele Menschen ist die Fähigkeit zu kommunizieren eine Selbstverständlichkeit, ein nahtloser Fluss von Klang und Bedeutung. Doch für Menschen, die taub oder schwerhörig sind, präsentiert die Welt oft eine Wand des Schweigens, insbesondere wenn sie mit Menschen interagieren, die keine Gebärdensprache beherrschen. Die amerikanische Gebärdensprache, oder ASL, ist eine reiche, visuelle Sprache, bei der die Bedeutung durch die Form der Hand, die Bewegung der Finger und die Position der Handfläche getragen wird. Seit Jahrzehnten versuchen Forscher, Maschinen zu bauen, die eine Person beim Gebärden beobachten und diese Gesten in Wörter übersetzen können, in der Hoffnung, diese Lücke zu schließen. Frühe Versuche erforderten oft teure, sperrige Ausrüstung wie spezielle Sensorgestalten oder schwere Kameras, die Tiefen sehen konnten, was die Technologie für den alltäglichen Gebrauch unpraktisch machte. Das Ziel war es schon immer, einen Weg zu finden, um diese Übersetzung allein mit einer einfachen Kamera zu ermöglichen, wie etwa der Kamera, die in einem Laptop oder einem Telefon eingebaut ist, damit die Technologie von jedem, überall, genutzt werden kann.
Eine aktuelle Studie von Amna Atiq von der University of Engineering and Technology in Lahore unternimmt einen bedeutenden Schritt in Richtung dieses Ziels. Die Forscherin entwickelte ein System, das die statischen Buchstaben des amerikanischen Gebärdens alphabets in Echtzeit erkennen kann, und zwar mit nichts weiter als einer Standard-Webcam und einem Computer. Anstatt sich auf komplexe Hardware zu verlassen, nutzt das System ein Softwarewerkzeug namens MediaPipe, das als digitales Auge fungiert. Dieses Werkzeug scannt den Video-Feed und findet einundzwanzig spezifische Punkte an einer menschlichen Hand, wie etwa die Spitze des Daumens, die Knöchel und das Handgelenk. Es verfolgt diese Punkte, während sie sich bewegen, und erstellt so ein digitales Skelett der Hand, das im dreidimensionalen Raum existiert. Indem sich das System auf die Position dieser Punkte konzentriert anstatt auf die rohen Pixel des Bildes, kann es Ablenkungen wie Hintergrundunruhe oder Veränderungen der Beleuchtung ignorieren und sich nur auf die Form der Hand selbst konzentrieren.
Sobald die Software die Hand kartiert hat, sendet sie diese Information an ein kleines, effizientes Computerprogramm, das darauf ausgelegt ist, Muster zu lernen. Dieses Programm, eine Art von künstlicher Intelligenz, die als tiefes neuronales Netz bekannt ist, wurde mit einer Sammlung von über sechstausend Beispielen von Handgesten trainiert. Jedes Beispiel zeigte die Hand, wie sie einen Buchstaben von A bis Z formte. Das Programm lernte, die spezifische Anordnung der einundzwanzig Handpunkte mit dem korrekten Buchstaben zu verknüpfen. Um zu testen, wie gut dies funktionierte, teilte die Forscherin die Daten auf, indem sie den Großteil der Daten zum Lehren des Programms verwendete und einen separaten Teil zur Überprüfung seines Wissens zurückbehielt. Die Ergebnisse waren beeindruckend: Das System identifizierte die Handgeste in fast neunundneunzig Prozent der Testfälle korrekt. Es war in der Lage, dies schnell genug zu tun, um mit einem Live-Video-Feed Schritt zu halten, indem es jeden Frame in etwa zweiunddreißig Millisekunden verarbeitete, was schnell genug ist, um für einen menschlichen Beobachter unmittelbar zu wirken.
Die Studie untersuchte auch genau, wo das System stolpern könnte. Während es bei den meisten Buchstaben außergewöhnlich gut abschnitt, verwechselte es gelegentlich Buchstaben, die sich sehr ähnlich sehen, wie etwa M, N und T. Dies ist eine natürliche Herausforderung, da diese Zeichen subtile Unterschiede in der Fingerpositionierung beinhalten, die selbst für Menschen schwer zu unterscheiden sind, wenn die Sicht nicht perfekt ist. Trotz dieser kleinen Stolpersteine bewies das System, dass hohe Genauigkeit keine massiven Supercomputer oder spezialisierten Sensoren erfordert. Der gesamte Aufbau lief reibungslos auf einem Standard-Laptop mit acht Gigabyte Arbeitsspeicher, was demonstriert, dass leistungsstarke assistive Technologie leichtgewichtig und zugänglich sein kann. Die Forscherin merkte an, dass das System am besten mit statischen Gesten funktioniert, also einzelnen Buchstaben, die an einem Ort gehalten werden, und nicht mit der fließenden, kontinuierlichen Bewegung ganzer Sätze, was eine komplexere Herausforderung für die Zukunft bleibt.
Was diese Arbeit besonders bedeutungsvoll macht, ist ihr Fokus auf die Praktikabilität. Indem sie die Notwendigkeit von Handschuhen, Tiefenkameras oder High-End-Grafikkarten weglässt, zeigt die Forschung, dass ein Werkzeug, das in der Lage ist, Gebärdensprache zu übersetzen, bald für jeden mit einem Computer und einer Internetverbindung verfügbar sein könnte. Das System erkennt nicht nur Formen; es öffnet eine Tür zur Kommunikation für Menschen, die ansonsten isoliert sein könnten. Die Forscherin plant, auf diesem Fundament aufzubauen, indem sie das System lehrt, den Fluss dynamischer Zeichen zu verstehen, und die Software so anzupassen, dass sie auf mobilen Geräten läuft. Für den Moment stellt die Errungenschaft eine klare Demonstration dar, dass wir mit der richtigen Kombination aus Software und einfacher Hardware beginnen können, die Barrieren abzubauen, die die Hörenden und die Gehörlosen trennen, und eine Standard-Webcam in eine Brücke für menschliche Verbindung verwandeln.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.