← أحدث الأبحاث
💻 computer science

Monocular Relative-Depth-Based Person Detection: The UWRD-Person Benchmark and RHyME-Net

تقدم هذه الورقة مجموعة بيانات الاختبار UWRD-Person وتقترح شبكة RHyME-Net، وهي شبكة مبتكرة تستفيد من تمثيلات العمق النسبي لتحقيق كشف قوي للأشخاص في المشاهد ذات الزاوية فائقة الاتساع من خلال معالجة تحديات مثل تباين الحجم والانسداد مع تقليل الاعتماد على ملامح المظهر المرئي (RGB).

المؤلفون الأصليون: YAO TONG, JIA XU ZHANG, HAO YUAN LI, CHEN SOON CHEE

نُشر 2026-09-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: YAO TONG, JIA XU ZHANG, HAO YUAN LI, CHEN SOON CHEE

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الرؤية الحاسوبية المزدحم والفوضوي، تُعد تعليم الآلة كيفية رؤية البشر مهمة تهيمن عليها الألوان عادةً. تلتقط الكاميرات حمرة القميص، ونمط المعطف، وملمس الجلد، وتغذي هذه البيانات المرئية الغنية بالخوارزميات التي تتعلم التعرف على الهيئة البشرية. لكن هذا الوفرة من التفاصيل تأتي بتكلفة: فكلما رأت المنظومة تفاصيل أكثر، زاد خطر تعلم أشياء لا ينبغي لها تعلمها، مثل هوية الشخص أو ملابسه المحددة، مما قد يشكل مشكلة للخصوصية في الأماكن العامة. لطالما تساءل الباحثون عما إذا كان بإمكان الآلة أن تتعلم العثور على الأشخاص باستخدام شكل العالم والمسافة النسبية بين الأشياء فقط، مجردةً إياها تماماً من الألوان والأنسجة المشتتة. يعتمد هذا النهج على مفهوم يسمى "العمق النسبي"، وهو في الأساس خريطة توضح مدى بعد الأشياء عن الكاميرا مقارنة ببعضها البعض، دون الحاجة إلى معرفة المسافة الدقيقة بالأمتار. إنها طريقة لرؤية الهيكل العظمي للمشهد بدلاً من جلده.

لقد اتخذ فريق من الباحثين من ماليزيا وماكاو هذه الفكرة واختبرها في بيئة محددة للغاية ومتحدية: كاميرا ثابتة ذات زاوية فائقة الاتساع تراقب تقييماً بدنياً مزدحماً. أرادوا معرفة ما إذا كان بإمكان الكمبيوتر العثور على كل شخص في الإطار، حتى عندما يكونوا متجمعين معاً، أو مخفيين جزئياً، أو مقطوعين عند حافة الصورة، باستخدام خريطة العمق هذه كعيون له فقط. وللقيام بذلك، بنوا معياراً جديداً يسمى UWRD-Person v1.0، وهو مجموعة تضم ما يقرب من 1,800 صورة وأكثر من 7,000 شخص مُصنف مستمد من 50 تسلسلاً فيديو متميزاً. ومن الأهمية بمكان أنهم ضمنوا أن الأشخاص والمشاهد المستخدمة لاختبار النظام كانت مختلفة تماماً عن تلك المستخدمة لتدريبه، مما منع الكمبيوتر من مجرد حفظ وجوه أو حركات عدد قليل من الأفراد. ثم صمموا نظاماً جديداً يسمى RHyME-Net، والذي يعمل كدليل متخصص، يساعد الكمبيوتر على فهم كيفية ارتباط الأجزاء المختلفة من الشخص ببعضها البعض عبر الصورة، حتى عندما تكون الرؤية مشوهة أو محجوبة.

كانت نتائج هذه التجربة كبيرة. فعند اختبارها على تسلسلات الفيديو غير المرئية سابقاً، نجح النظام الجديد في تحديد مواقع الأشخاص بدقة عالية، حيث وجد الغالبية العظمى من الأفراد الموجودين في المشهد. حقق معدل استدعاء يزيد عن 80 بالمائة، مما يعني أنه لم يفت الكثير من الأشخاص، وفعل ذلك بسرعة معالجة تقترب من 33 إطاراً في الثانية، وهو ما يكفي للمراقبة في الوقت الفعلي. أثبت النظام كفاءة خاصة في التعامل مع المواقف الصعبة حيث يقف الناس بالقرب من بعضهم البعض أو حيث تمدد عدسة الزاوية العريضة الصورة، مما يجعل الأشخاص بالقرب من الحواف يبدون مشوهين. ومن خلال التركيز على العلاقات الهندسية بين أجزاء الجسم بدلاً من لون القميح أو شكل الوجه، تمكن النظام من تجاهل الضجيج البصري الذي غالباً ما يربك الكاميرات القياسية.

ومع ذلك، كان الباحثون حذرين في تحديد حدود ما حققوه. فقد صرحوا صراحةً بأن هذه الطريقة ليست عصا سحرية للخصوصية. فبينما يتجاهل النظام ملامح الوجه وألوان الملابس للقيام بعمله، فإن خريطة العمق الناتجة لا تزال تحتفظ بمخطط جسم الشخص ومشِيته. وهذا يعني أنه بينما يعد النظام ممتازاً لعد الأشخاص أو مراقبة كثافة الحشود دون الحاجة إلى تحديد هويتهم، فإنه لا يجعل البيانات مجهولة المصدر تلقائياً. إذ يمكن لمراقب مصمم أن يستخدم شكل حركة الشخص لإعادة تحديد هويته. كما أوضحت الدراسة أن هذا النهج لم يثبت أنه أفضل من استخدام كاميرات كاملة الألوان في كل موقف؛ بل أظهر أن الآلة يمكن تدريبها للاعتماد فقط على معلومات العمق لحل مشكلة محددة: وهي العثور على الأشخاص في عرض ثابت ومزدحم.

اعتمد نجاح المشروع على كيفية تعامل الفريق مع البيانات وبنية نظامهم الجديد. لقد جمعوا مقاطع فيديو من ميدان رياضي جامعي، حيث تحرك الطلاب عبر نقطة تفتيش، وحولوا اللقطات إلى خرائط عمق باستخدام أداة ذكاء اصطناعي قياسية. ثم قاموا بفحص آلاف الصناديق المحيطة (bounding boxes) يدوياً لضمان معرفة الكمبيوتر بالضبط أين يبدأ الشخص وأين ينتهي، حتى لو كانت أجزاء منه مخفية خلف آخرين. يستخدم النظام الجديد الذي بنوه، RHyME-Net، ثلاث استراتيجيات رئيسية لتحسين الأداء. أولاً، يبحث عن الروابط بين أجزاء مختلفة من الصورة لفهم كيفية تجميع الناس معاً، مما يساعد عندما يكون الناس مزدحمين. ثانياً، يضبط تركيزه اعتماداً على موقع الشخص في الإطار، مدركاً أن الشخص القريب من حافة عدسة الزاوية العريضة يبدو مختلفاً عن الشخص في المركز. ثالثاً، ينشئ مساراً للكمبيوتر لمشاركة المعلومات بين التفاصيل الدقيقة للصورة والفهم الأوسع للمشهد، مما يضمن عدم فقدان الشخصيات الصغيرة أو البعيدة.

في النهاية، يقدم العمل إجابة واضحة على سؤال محدد: نعم، يمكن تعليم الكمبيوتر العثور على الأشخاص في مشهد واقعي معقد باستخدام خريطة المسافات النسبية فقط، دون الحاجة لرؤية الألوان أو الأنسجة. وجد النظام 1,479 شخصاً في مجموعة الاختبار بدقة عالية، مما يثبت أن الهيكل الهندسي للمشهد كافٍ لهذه المهمة. ومع ذلك، يظل الباحثون واقعيين في نتائجهم؛ فلم يدّعوا أنهم حلوا مشكلة الخصوصية، ولم يقترحوا أن هذه الطريقة يجب أن تحل محل جميع طرق الرؤية الأخرى. بدلاً من ذلك، قدموا أداة جديدة للحالات التي يكون فيها الهدف ببساطة هو معرفة وجود أشخاص، وعدد هؤلاء الأشخاص، وأين يقفون، مع تقليل التعرض للتفاصيل الشخصية. وتقف الدراسة كدليل على كيف يمكن لتحديد ما تراه الآلة أن يساعدها أحياناً على الرؤية بوضوح أكبر، شريطة أن تكون المهمة محددة جيداً ويتم التعامل مع البيانات بعناية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →