Sound-based Multi-Person 3D Pose Estimation
تقدم هذه الورقة البحثية SoundMHPE، وهو أول إطار عمل لتقدير وضعيات الأجسام ثلاثية الأبعاد لعدة أشخاص اعتماداً فقط على الإشارات الصوتية من خلال استخدام بنية مشفر-فك تشفير مبتكرة للتغلب على تحديات مثل تراكب الإشارات والانعكاسات، وقد تم التحقق من صحته باستخدام مجموعة بيانات متزامنة تم إنشاؤها حديثاً ومدتها 6 ساعات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
على مدى عقود، سعى العلماء لإيجاد طرق لرؤية ما لا يُرى، حيث طوروا تقنيات يمكنها تتبع الحركة البشرية دون الاعتماد على العين البشرية. فالكاميرات، التي تعتمد على الضوء، تفشل في الظلام أو عندما يكون الشخص مختبئاً خلف جدار. أما الموجات الراديوية، المستخدمة في بعض أنظمة الاستشعار، فتواجه صعوبات عندما تصطدم بالماء أو المعدن. وفي هذه السيناريوهات المعقدة والواقعية، برز نوع مختلف من الإشارات كبديل واعد: وهو الصوت. فمن خلال إرسال نبضة صوتية بشكل نشط والاستماع بعناية لكيفية ارتدادها، يمكن للباحثين رسم خريطة لشكل وموقع الأجسام في الغرفة. وقد أظهرت هذه التقنية، المعروفة باسم الاستشعار الصوتي النشط، قدرتها بالفعل على تحديد وضعية جسم شخص واحد، حتى عندما يكون محجوباً. ومع ذلك، ظلت هناك فجوة كبيرة في هذا المجال؛ فبينما يخلق صوت واحد أو حركة واحدة صدىً مميزاً، فإن الغرفة المليئة بأشخاص متعددين تخلق مزيجاً فوضوًا من الأصوات المتداخلة. وقد كان فك تشابك هذه الإشارات لفهم مكان وقوف كل فرد وكيفية حركته أمراً يُعتبر شبه مستحيل، حيث تختلط أصداء شخص ما مع أصداء الآخرين بشكل لا يمكن تمييزه.
لقد اتخذ فريق من الباحثين من جامعة كيو، وجامعة طوكيو للعلوم، وشركة NTT الآن الخطوة الأولى نحو حل هذه المشكلة. فقد طوروا نظاماً قادراً على تقدير الوضعيات ثلاثية الأبعاد لعدة أشخاص باستخدام الصوت فقط. قام الباحثون ببناء مجموعة بيانات مخصصة لتدريب نظامهم، حيث سجلوا ست ساعات من البيانات الصوتية والحركية المتزامنة لما يصل إلى ثلاثة أشخاص يتحركون في آن واحد داخل غرفة. تضمن الإعداد زوجاً من مكبرات الصوت التي تبث إشارة صوتية محددة، وميكروفوناً متخصصاً قادراً على التقاط الصوت من جميع الاتجاهات. وبينما كان المشاركون يمشون، ويلتفون، ويرفعون أذرعهم، سجل النظام الأصداء المرتدة. كان التحدي هائلاً؛ إذ كانت الإشارات الصوتية عبارة عن تراكب للعديد من الحركات المختلفة، وهو أمر زاد من تعقيده الطريقة التي ينعكس بها الصوت عن الأجساد والجدران، مما يخلق تأخيرات تحجب الرابط المباشر بين وضعية معينة وتغير صوتي محدد.
وللتنقل عبر هذا التعقيد، أنشأ الفريق إطار عمل جديداً أطلقوا عليه اسم SoundMHPE. فبدلاً من محاولة معالجة الصوت ككتلة واحدة فوضوية، يقوم نظامهم بتفكيك الصوت إلى طبقات متعددة من التفاصيل. فهو يحلل الصوت باستخدام نوافذ زمنية مختلفة، حيث ينظر إلى التغيرات السريعة التي تحدث في جزء من الثانية، وكذلك التفاصيل الأبطأ والأكثر دقة في تردد الصوت. وهذا يسم أن النظام يعزل البصمات الصوتية الدقيقة التي قد تضيع لولا ذلك في الضجيج. وبمجرد تحليل الصوت، يستخدم النظام طريقة متطورة لفصل الأشخاص؛ حيث يخصص مجموعة محددة من "الاستعلامات" الرقمية لكل فرد، مما يسمح للبرنامج بتتبع التطور الزمني لحركات الشخص الواحد مع فهم كيفية تفاعله مع الآخرين في الغرفة في الوقت ذات ذاته. هذا النهج يفك تشابك المعلومات المتداخلة، مما يمكن النظام من إعادة بناء وضعية كل شخص إطاراً تلو الآخر.
تثبت نتائج هذا العمل أن النظام يعمل بفعالية. فعند اختباره مقابل الطرق الموجودة التي صُممت أصلاً لتتبع الشخص الواحد أو تم تكييفها من استشعار الموجات الراديوية، أثبت النظام القائم على الصوت الجديد أنه أكثر دقة. لقد نجح في تتبع الحركات المعقدة، مثل التواء جسم الشخص أو رفع كلتا ذراعيه، حتى عند القيام بذلك جنباً إلى جنب مع أفراد آخرين يتحركون. وفي الاختبارات التي شملت شخصين وثلاثة أشخاص، حافظ النظام على مستوى عالٍ من الدقة، متفوقاً على النماذج المرجعية في قياس المسافة بين المواقع المتوقعة والمواقع الفعلية للمفاصل. كما وجد الباحثون أن طريقتهم يمكن أن تتكيف مع البيئات غير المرئية؛ فعندما وضعوا حواجز في الغرفة لتغيير كيفية انعكاس الصوت، تمكن النظام من تقدير الوضعيات العامة، مما يشير إلى قدرته على التعامل مع الظروف الصوتية المختلفة. علاوة على ذلك، ثبت أن المنطق الكامن وراء نظامهم فعال حتى عند تطبيقه على بيانات التردد اللاسلكي، مما يشير إلى أن هذا النهج قوي عبر أنواع مختلفة من الإشارات.
يمثل هذا البحث توسعاً كبيراً لما هو ممكن في مجال الاستشعار الصوتي. فمن خلال الانتقال من سيناريوهات الشخص الواحد إلى بيئات متعددة الأشخاص، فتح الفريق الباب أمام تطبيقات في الأماكن المزدحمة، والإغاثة من الكوارث، وتحليل الرياضة حيث لا يمكن استخدام الكاميرات وقد تُحجب إشارات الراديو. ورغم أن هذه التكنولوجيا لا تزال في مراحلها الأولى وتتطلب مزيداً من التطوير ليتم نشرها في العالم الحقيقي، إلا أن بناء مجموعة البيانات الجديدة والتحقق من طريقة التقدير متعددة الأشخاص يوفران أساساً حاسماً. ويؤكد هذا العمل أن الصوت، عندما يُحلل بالأدوات الصحيحة، يمكنه الكشف عن الهندسة الخفية لمجموعة من الناس، محولاً مزيجاً فوضوياً من الأصداء إلى صورة واضحة للحركة البشرية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.