A Weighted Sparse Matrix Regression Model for Face Recognition
تقترح هذه الورقة نموذج انحدار المصفوفة المتناثرة الموزونة (WSMR) الذي يدمج المعلومات الهيكلية والمسافات للتعامل بفعالية مع الحجب المستمر في التعرف على الوجوه، باستخدام طريقة المضاعفات المتناوبة للاتجاه (ADMM) للتحسين، وتُظهر أداءً فائقاً من خلال التجارب على قواعد البيانات العامة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الحواسيب، تبدو مهمة تعليم الآلة التعرف على وجه بشري مهمة بسيطة بالنسبة لنا، لكنها صعبة بشكل مفاجئ بالنسبة لبرنامج حاسوبي. فالكمبيوتر لا يرى وجهاً مبتسماً أو جبينًا مقطباً؛ بل يرى شبكة من الأرقام التي تمثل بكسلات الضوء والظلام. وعندما يكون الوجه واضحاً ومضاءً جيداً، يمكن للكمبيوتر مطابقة هذه الأنماط بقاعدة بيانات لأسماء وجوه معروفة بدقة عالية. ومع ذلك، فإن العالم الحقيقي نادراً ما يكون مثالياً. فغالباً ما تكون الوجوه محجوبة جزئياً بنظارات شمسية، أو أوشحة، أو بظلال شجرة، ويمكن للإضاءة أن تتغير من شمس الظهيرة الساطعة إلى الظلام الدامس. وتخلق هذه الانقطاعات "ضجيجاً" في البيانات، مما يربك محاولة الكمبيوتر لإيجاد تطابق. ولسنوات، حاول الباحثون بناء أنظمة يمكنها تجاهل هذه المشتتات، بحثاً عن طريقة رياضية لفصل الهوية الحقيقية للشخص عن الفوضى التي تحجبها. والهدف هو إنشاء نظام يظل موثوقاً حتى عندما تكون الصورة تالفة أو غير مكتملة، تماماً كما يمكن للإنسان أن يتعرف على صديق يرتدي قبعة ونظارات شمسية في يوم ممطر.
اقترح فريق من الباحثين من جامعة تيانجين والجامعة الجنوبية للعلوم والتكنولوجيا في الصين منهجية جديدة لحل هذه المشكلة المحددة المتمثلة في الوجوه المحجوبة. وقد أطلقوا على نهجهم اسم "نموذج انحدار المصفوفة المتناثرة الموزونة". ولفهم كيفية عمله، تخيل أنك تحاول إعادة بناء صورة ممزقة. إذا حاولت ببساال مجرد ملء الأجزاء المفقودة بناءً على متوسط جميع الصور الأخرى التي لديك، فقد تحصل على صورة ضبابية مشوشة. بدلاً من ذلك، ينظر هذا المنهج الجديد إلى الأنماط المحددة للتلف. فقد أدرك الباحثون أنه عندما يتم حجب وجه ما بواسطة جسم ما، فإن الخطأ — وهو الفرق بين الوجه الحقيقي وتخمين الكمبيوتر — يميل إلى تشكيل كتلة كبيرة ومتصلة. حاولت الأساليب القديمة التعامل مع هذا الخطأ كأنه مجموعة من الأخطاء العشوائية والمتفرقة، وهو ما نجح جيداً مع البقع الصغيرة من الضجيج ولكنه فشل عندما كانت المساحات المحجوبة كبيرة. أما النموذج الجديد فيعامل الخطأ ككتلة مهيكلة، حيث ينظر إلى كيفية تغير البكسلات من صف إلى آخر. فهو يفترض أنه إذا كانت مساحة كبيرة محجوبة، فإن التغييرات بين صفوف البكسلات ستكون متشابهة جداً، مما يخلق نمطاً يمكن التنبؤ به يمكن للكمبيوتر تعلم تجاهله.
كما قدم الباحثون طريقة لوزن أهمية مجموعات مختلفة من بيانات التدريب. ففي نظامهم، يتعلم الكمبيوتر من أمثلة عديدة لكل شخص. وعندما يحاول تحديد وجه مخفي، فإنه يحسب مدى قرب ذلك الوجه من مجموعات الوجوه المعروفة التي درسها. فإذا كانت مجموعة الوجوه المعروفة مشابهة جداً للوجه المخفي، فإن النموذج يعطي تلك المجموعة وزناً أعلى، مما يجعل احتمال كونها الإجابة الصحيحة أكبر. وإذا كانت المجموعة مختلفة جداً، فإن النموذج يخصص لها وزناً أقل، مما يخبر الكمبيوتر فعلياً بأن يوليها اهتماماً أقل. ويساعد نظام التوزين هذا الكمبيوتر على تجنب الخداع بوجوه تبدو متشابهة نوعاً ما ولكنها ليست المطابقة الصحيحة. علاوة على ذلك، يشجع النموذج الكمبيوتر على اتباع نهج تعاوني، حيث ينظر إلى كيفية عمل الأمثلة المختلفة لنفس الشخص معاً لتشكيل صورة كاملة، بدلاً من الاعتماد على صورة واحدة فقط.
ولاختبار فكرتهم، أجرى الباحثون نموذجهم مقابل عدة أساليب موجودة باستخدام أربع قواعد بيانات عامة لصور الوجوه. تضمنت هذه القواعد وجوهاً التُقطت في ظروف إضاءة قاسية، ووجوهاً مغطاة بكتل سوداء أو بيضاء، ووجوهاً ترتدي تنكرات حقيقية مثل النظارات الشمسية والأوشحة. وفي إحدى مجموعات الاختبارات، استخدموا صوراً من قاعدة بيانات (Extended YaleB)، حيث تم تصوير الوجوه تحت ظلال قاسية جداً. وعندما كانت الإضاءة شديدة، عانت الأساليب القديمة، حيث انخفضت معدلات التعرف لدى بعضها إلى أقل من 40 بالمائة. ومع ذلك، حافظ النموذج الجديد على معدل تعرف يزيد عن 90 بالمائة، متفوقاً بشكل كبير على غيره. وفي تجربة أخرى، قاموا بتغطية أجزاء من الوجوه بكتل ملونة صلبة أو حتى صور أخرى، لمحاكاة الحجب الكثيف. وعندما زاد حجم المنطقة المحجوبة لتغطي ما يقرب من ثلثي الوجه، استمر النموذج الجديد في تحديد الشخص بشكل صحيح بنسبة 77 بالمائة تقريباً، بينما تراجعت الأساليب الأخرى كثيراً.
كما قارن الفريق نهجهم بأنظمة التعلم العميق الحديثة، وهي برامج حاسوبية قوية تتعلم من خلال معالجة كميات هائلة من البيانات. وبينما تعد نماذج التعلم العميق هذه ممتازة عندما تكون قد رأت أمثلة مشابهة أثناء تدريبها، إلا أنها واجهت صعوبات عند مواجهة أنواع جديدة من الحجب لم تصادفها من قبل. وفي المقابل، اعتمد نموذج الانحدار الجديد على قواعد رياضية حول كيفية هيكلة الأخطاء بدلاً من مجرد حفظ الأنماط. وقد سمح هذا له بالتعامل مع التنكرات الجديدة والمعقدة بشكل أكثر فعالية، حتى عندما كان عدد صور التدريب محدوداً. ووجد الباحثون أن طريقتهم كانت قوية بشكل خاص عندما كان الحجب مستمراً، مثل وشاح كبير يغطي النصف السفلي من الوجه، وهو سيناريو فشلت فيه العديد من الأنظمة الأخرى.
وتخلص الدراسة إلى أنه من خلال التركيز على هيكل الخطأ واستخدام نظام موزون لإعطاء الأولوية لبيانات التدريب الأكثر صلة، يمكن بناء نظام للتعرف على الوجوه يكون أكثر قوة ضد التداخلات في العالم الحقيقي. وقد أظهر الباحثون أن نموذجهم يمكن حله بكفاءة باستخدام خوارزمية رياضية محددة، مما يسمح له بمعالجة الصور بسرعة. وبينما يقرون بأن عملهم هو خطوة للأمام وليس حلاً نهائياً، إلا أن النتائج تشير إلى أن هذا النهج يوفر بديلاً موثوقاً للحالات التي تكون فيها الوجوه محجوبة بشدة أو تكون الإضاءة سيئة. وتشير النتائج إلى أن فهم هندسة المعلومات المفقودة لا يقل أهمية عن المعلومات المتبقية، مما يوفر مساراً أوضح للأنظمة المستقبلية للتعرف علينا حتى عندما نكون محجوبين جزئياً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.