Human Fall Detection Using Deep Learning Methods: A Multimodal Audio-Video Approach
تقترح هذه الدراسة إطار عمل للتعلم العميق متعدد الوسائط يدمج الميزات الصوتية والمرئية باستخدام تقنية التراكم على مستوى القرار لتحقيق دقة بنسبة 98% في اكتشاف سقوط البشر، وهو ما يتفوق بشكل كبير على النماذج أحادية الوسائط واستراتيجيات الدمج الأخرى.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تُعد السقوطات تهديداً صامتاً، لا سيما لكبار السن، حيث يمكن لتعثر واحد أن يؤدي إلى إصابة، أو فقدان للاستقلالية، أو ما هو أسوأ. لعقود من الزمن، كان الحل غالباً يتمثل في مطالبة الأشخاص بارتداء جهاز، مثل قلادة أو سوار معصم، يمكنه استشعار السقوط المفاجئ. لكن هذه الأجهزة بها عيب: فهي تعتمد على تذكر الشخص لارتدائها، ويمكن أن تكون غير مريحة أو تسبب شعوراً بالوصمة. وقد دفع هذا الباحثين للبحث عن وسيلة للمراقبة والاستماع دون لمس، باستخدام الكاميرات والميكروفونات لرصد السقوط في اللحظة التي يحدث فيها. التحدي يكمكم في أن السقوط يشبه في مظهره وصوته العديد من الأفعال اليومية الأخرى، مثل الجلوس بسرعة، أو الانحناء لربط الحذاء، أو حتى مجرد الاستلقاء للراحة. ولحل ذلك، توجه العلماء إلى التعلم العميق، وهو نوع من الذكاء الحاسوبي الذي يتعلم الأنماط من خلال دراسة آلاف الأمثلة، تماماً كما يتعلم الطفل التعرف على الكلب من خلال رؤية العديد من الكلاب المختلفة. ومن خلال تعليم هذه الأنظمة فهم الحركة البصرية للجسم والأصوات التي يصدرها، يأمل الباحثون في إنشاء شبكة أمان تراقب دائماً، وتستمع دائماً، وتكون مستعدة دائماً لإطلاق إنذار.
وضع فريق من الباحثين من جامعات في باكستان وإيطاليا خطة لبناء هذا النوع من الأنظمة بالضبط، ولكن مع لمسة خاصة: أرادوا معرفة ما إذا كان الجمع بين الرؤية والصوت يمكن أن يؤدي أداءً أفضل من كل حاسة على حدة. بدأوا بمجموعة من التسجيلات المرئية التي أظهرت أشخاصاً يحاكون السقوط بالإضافة إلى القيام بأنشطة عادية مثل المشي أو الجلوس. عامل الباحثون الفيديو والصوت كمسارين منفصلين من المعلومات. أولاً، قاموا بعزل الصوت من كل مقطع فيديو. قاموا بتحويل الصوت إلى قناة واحدة ثم فككوه إلى خريطة مفصلة لتردداته بمرور الوقت، بحثاً عن الارتفاعات الحادة والمفاجئة في الطاقة التي تحدث عندما يصطدم الجسم بالأرض. استخدموا طريقة رياضية لضغط بيانات الصوت هذه إلى شكل يمكن إدارته، ثم طبقوا عملية بحث حاسوبية لاختيار الميزات الصوتية الأكثر فائدة فقط، واستبعاد الضوضاء. تم تغذية هذه الميزات المختارة في نوع من الأدمغة الاصطناعية المصممة لتذكر المتواليات، مما يسمح لها بفهم أن السقوط هو نمط صوتي محدد يحدث خلال ثوانٍ معدودة، وليس مجرد ضوضاء عابرة.
في الوقت نفسه، نظر الباحثون في إطارات الفيديو. لم يحاولوا التعرف على وجه الشخص أو ملابسه؛ بل ركزوا تماماً على كيفية تحرك الجسم. أنشأوا ملخصاً بصرياً خاصاً يوضح أين حدثت الحركة في الثواني القليلة الماضية، مع تسليط الضوء على مسار الحركة وتلاشي الأجزاء الساكنة القديمة من المشهد. ومن هذه الصورة المتحركة، تتبعوا الخطوط العريضة للشخص للحصول على شكل واضح لحركته. ومثلما حدث مع الصوت، قاموا بتغذية هذه الأنماط البصرية في نموذج حاسوبي لتعلم المتواليات يمكنه تتبع كيفية تغير شكل الحركة من لحظة إلى أخرى. كانت النتيجة خبيرين منفصلين: أحدهما جيد في الاستماع للسقوط، والآخر جيد في رؤيته. حدد النظام القائم على الصوت السقوط بشكل صحيح بنسبة 81 في المئة من المرات، بينما كان النظام القائم على الفيديو أكثر دقة، حيث حقق نسبة 92 في المئة.
ومع ذلك، لم يكن الاختبار الحقيقي في كيفية عمل كل نظام بمفرده، بل في كيفية عملهما معاً. جرب الباحثون ست طرق مختلفة لدمج قرارات أنظمة الصوت والفيديو. كانت بعض الطرق بسيطة، مثل أخذ متوسط الدرجتين أو ترك التصويت للأغلبية لتحديد النتيجة. أدت هذه الأساليب البسيطة إلى أداء ضعيف، حيث انخفضت دقة بعض التوليفات إلى 36 في المئة. أظهر هذا أن مجرد خلط الإشارتين لم يكن كافياً؛ إذ كان النظام بحاجة إلى طريقة أذكى لوزن الأدلة. جرب الباحثون بعد ذلك طريقة حيث تعلم نموذج حاسوبي ثالث أكثر تقدماً كيفية دمج مخرجات خبراء الصوت والفيديو. حقق هذا النظام النهائي، الذي عمل مثل مشرف يراجع عمل متخصصين، دقة مذهلة بلغت 98 في المئة. كان قادراً على رصد السقوط حتى عندما كان أحد الحواس غير متأكد، حيث استخدم بفعالية قوة الفيديو لدعم الصوت، أو وضوح الصوت لتأكيد الرؤية البصرية.
تشير الدراسة إلى أنه بينما تعتبر الكاميرات قوية، فإن إضافة الصوت يخلق شبكة أمان أكثر موثوقية. وجد الباحثون أن السقوطات تنتج بصمات صوتية مميزة غالباً ما تفوتها الأنظمة التي تعتمد على الرؤية فقط، خاصة إذا كان الشخص مخفياً جزئياً أو إذا كانت الإضاءة ضعيفة. وعلى العكس من ذلك، يمكن أن يرتبك الصوت بسبب الضوضاء الخلفية، مما يجعل التأكيد البصري أمراً ضرورياً. ومن خلال استخدام طريقة متطورة لدمج هذين المسارين من المعلومات، أثبت الفريق أن النهج متعدد الوسائط يتفوق بمراحل على الاعتماد على حاسة واحدة. ومع ذلك، أشاروا إلى أن نتائجهم جاءت من مجموعة صغيرة نسبياً من السقوطات المحاكات في بيئة محكومة، وأن الظروف الواقعية مع وجود أشخاص متعددين، ومستويات ضوضاء متفاوتة، وزوايا كاميرا مختلفة، ستطرح تحديات جديدة. لا يدعي العمل أنه حل مشكلة اكتشاف السقوط تماماً، ولكنه يوفر أساساً قوياً للأنظمة المستقبلية التي يمكنها مراقبة المنازل ومرافق الرعاية بثقة أكبر، مما يضمن أنه عند حدوث سقوط، يمكن طلب المساعدة فوراً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.