American Sign Language Recognition Using Mediapipe and Deep Learning: A Real-Time Approach
تقدم هذه الورقة نظاماً للتعرف على لغة الإشارة الأمريكية في الوقت الفعلي وبوزن خفيف، يستخدم تقنية Google MediaPipe للكشف عن معالم اليد وشبكة عصبية عميقة لتحقيق دقة تصل إلى 98.49% في تصنيف إيماءات أبجدية لغة الإشارة الأمريكية الساكنة على الأجهزة الاستهلاكية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
بالنسبة للكثير من الناس، تُعد القدرة على التواصل أمرًا مفروغًا منه، تدفقًا سلسًا من الصوت والمعنى. ولكن بالنسبة للصم أو ضعاف السمع، غالبًا ما يفرض العالم جدارًا من الصمت، خاصة عند التفاعل مع أشخاص لا يعرفون لغة الإشارة. لغة الإشارة الأمريكية (ASL) هي لغة بصرية غنية، حيث يُنقل المعنى من خلال شكل اليد، وحركة الأصابع، ووضعية الكف. لعقود من الزمن، حاول الباحثون بناء آلات يمكنها مراقبة شخص يوقع وترجمة تلك الإيماءات إلى كلمات، آملين في سد تلك الفجوة. تطلبت المحاولات المبكرة غالبًا معدات باهظة الثمن وضخمة مثل قفازات خاصة مزودة بمستشعرات أو كاميرات ثقيلة يمكنها رؤية العمق، مما جعل التكنولوجيا غير عملية للاستخدام اليومي. كان الهدف دائمًا هو إيجاد طريقة لجعل هذه الترجمة تحدث باستخدام كاميرا بسيطة فقط، مثل تلك المدمجة في جهاز كمبيوتر محمول أو هاتف، بحيث يمكن استخدام التكنولوجيا من قبل أي شخص، في أي مكان.
تأخذ دراسة حديثة أجرتها آمنة عتيق من جامعة الهندسة والتكنولوجيا في لاهور خطوة كبيرة نحو تحقيق ذلك الهدف. فقد طورت الباحثة نظامًا يمكنه التعرف على الحروف الثابتة لأبجدية لغة الإشارة الأمريكية في الوقت الفعلي، باستخدام لا شيء سوى كاميرا ويب قياسية وجهاز كمبيوتر. وبدلاً من الاعتماد على أجهزة معقدة، يستخدم النظام أداة برمجية تسمى "MediaPipe" لتعمل كعين رقمية. تقوم هذه الأداة بمسح بث الفيديو وتجد واحد وعشرين نقطة محددة على يد الإنسان، مثل طرف الإبهام، والمفاصل، والمعصم. وهي تتبع هذه النقاط أثناء حركتها، مما ينشئ هيكلًا عظميًا رقميًا لليد يوجد في فضاء ثلاثي الأبعاد. ومن خلال التركاليز على موضع هذه النقاط بدلاً من البكسلات الخام للصورة، يمكن للنظام تجاهل المشتتات مثل الفوضى في الخلفية أو تغيرات الإضاءة، والتركيز فقط على شكل اليد نفسها.
بمجرد أن يقوم البرنامج برسم خريطة لليد، فإنه يرسل هذه المعلومات إلى برنامج كمبيوتر صغير وفعال مصمم لتعلم الأنماط. هذا البرنامج، وهو نوع من الذكاء الاصطناعي المعروف باسم الشبكة العصبية العميقة، تم تدريبه على مجموعة تضم أكثر من ستة آلاف مثال لإيماءات اليد. أظهر كل مثال اليد وهي تشكل حرفًا من أ إلى ي (A إلى Z). تعلم البرنامج ربط الترتيب المحدد لنقاط اليد الواحد والعشرين بالحرف الصحيح. ولاختبار مدى نجاح ذلك، قامت الباحثة بتقسيم البيانات، حيث استخدمت معظمها لتعليم البرنامج واحتفظت بجزء منفصل لاختبار معرفته. كانت النتائج مذهلة: حدد النظام إيماءة اليد بشكل صحيح في ما يقرب من تسعة وتسعين بالمائة من حالات الاختبار. وكان قادرًا على القيام بذلك بسرعة كافية لمواكبة بث فيديو مباشر، حيث عالج كل إطار في حوالي اثنين وثلاثين مللي ثانية، وهو ما يكفي ليكون لحظيًا بالنسبة للمراقب البشري.
كما نظرت الدراسة عن كثب في المواضع التي قد يتعثر فيها النظام. فبينما كان أداؤه ممتازًا في معظم الحروف، إلا أنه خلط أحيانًا بين الحروف التي تبدو متشابهة جدًا، مثل M و N و T. وهذا تحدٍ طبيعي، حيث تتضمن هذه الإشارات اختلافات دقيقة في وضعية الأصابع يصعب تمييزها حتى بالنسبة للبشر إذا لم تكن الرؤية مثالية. رغم هذه الهفوات الطفيفة، أثبت النظام أن الدقة العالية لا تتطلب أجهزة كمبيوتر عملاقة أو مستشعرات متخصصة. لقد عمل النظام بالكامل بسلاسة على جهاز كمبيوتر محمول قياسي بذاكرة ثمانية جيجابايت، مما يثبت أن التكنولوجيا المساعدة القوية يمكن أن تكون خفيفة الوزن وسهلة الوصول. وأشارت الباحثة إلى أن النظام يعمل بشكل أفضل مع الإشارات الثابتة، أي الحروف المفردة التي يتم تثبيتها في مكانها، بدلاً من الحركة المستمرة والمتدفقة للجمل الكاملة، والتي تظل تحديًا أكثر تعقيدًا في المستقبل.
إن ما يجعل هذا العمل ذا مغزى بشكل خاص هو تركيزه على الجانب العملي. فمن خلال تجريد الحاجة إلى القفازات، أو كاميرات العمق، أو بطاقات الرسوميات عالية الأداء، تظهر الأبحاث أن أداة قادرة على ترجمة لغة الإشارة يمكن أن تتوفر قريبًا لأي شخص لديه جهاز كمبيوتر واتصال بالإنترنت. النظام لا يتعرف على الأشكال فحسب؛ بل يفتح بابًا للتواصل للأشخاص الذين قد يعانون من العزلة بخلاف ذلك. تخطط الباحثة للبناء على هذا الأساس من خلال تعليم النظام فهم تدفق الإشارات الديناميكية وتكييف البرنامج ليعمل على الأجهزة المحمولة. وفي الوقت الحالي، يقف هذا الإنجاز كدليل واضح على أنه مع الجمع الصحيح بين البرمجيات والأجهزة البسيطة، يمكننا البدء في تفكيك الحواجز التي تفصل بين السامعين والصم، وتحويل كاميرا ويب قياسية إلى جسر للتواصل البشري.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.