OccFace: Unified Occlusion-Aware Facial Landmark Detection with Per-Point Visibility
تُعد "OccFace" إطار عمل موحداً واعياً بالانسداد للوجوه المتنوعة الشبيهة بالبشر، حيث يتنبأ بشكل مشترك بإحداثيات المعالم الوجهية ووضوح كل نقطة من خلال دمج الأدلة المحلية مع سياق المعالم المتقاطع.
المؤلفون الأصليون:Xinhao Xiang, Zhengxin Li, Saurav Dhakad, Theo Bancroft, Jiawei Zhang, Weiyang Li
تخيل أنك تلعب لعبة "سايمون يقول" (Simon Says) عالية التقنية مع شخصية رقمية. لكي تتحرك الشخصية بواقعية — لتغمز، أو تبتسم، أو تبدو متفاجئة — يحتاج الكمبيوتر إلى معرفة مكان "المعالم الوجهية" بدقة (زوايا العينين، طرف الأنف، حواف الفم).
ولكن هناك مشكلة: الحياة ليست صورة مثالية في استوديو. أحياناً تغطي يدٌ ما الفم، أو تسقط خصلة شعر فوق عين، أو يلتفت وجه الشخصية بعيداً لدرجة أن إحدى أذنيها تختفي عن الأنظار.
معظم أنظمة الذكاء الاصطناعي الحالية "تصاب بالارتباك" في هذه اللحظات؛ فهي تحاول تخمين مكان الأجزاء المخفية، مما يؤدي غالباً إلى حركات "متلعثمة" أو مشوهة — مثل تمدد فم الشخصية باتجاه اليد أو طفو عين في الهواء.
لقد ابتكر الباحثون "OccFace" لحل هذه المشكلة. وإليك كيف يعمل، من خلال ثلاث أفكار بسيطة:
١. "الخريطة التفصيلية" (تخطيط الـ ١٠٠ نقطة)
تستخدم معظم أنظمة الذكاء الاصطناعي خريطة أساسية للوجه، تشبه رسماً تخطيطياً بسيطاً يحتوي على نقاط قليلة فقط. أما OccFace فيستخدم خريطة أكثر تفصيلاً تضم ١٠٠ نقطة.
التشبيه: تخيل أنك تحاول التنقل في مدينة باستخدام أربعة طرق سريعة رئيسية فقط (الطريقة القديمة)، مقابل استخدام نظام تحديد مواقع (GPS) تفصيلي يظهر كل شارع جانبي، وزقاق، ومنتزه (طريقة OccFace). ولأن الخريطة مفصلة للغاية، فإن الذكاء الاصطناعي يفهم "هندسة" الوجه بشكل أفضل بكثير، حتى لو كان وجهاً كرتونياً، أو حيواناً، أو روبوتاً.
٢. "المحقق" (وحدة الحجب/التعتيم)
هذا هو "عقل" OccFace. بدلاً من مجرد التخمين أين تقع النقطة، يسأل الذكاء الاصطناعي نفسه الآن سؤالين: "أين تقع هذه النقطة؟" و "هل يمكنني رؤيتها بالفعل؟"
المحقق المحلي: هذا الجزء ينظر بدقة إلى بقعة محددة. إذا رأى كتلة ضبابية (مثل الشعر)، فإنه يقول: "مهلاً، هناك شيء يحجب هذه العين!"
محقق السياق: هذا الجزء ينظر إلى "الصورة الكبيرة". إذا أدارت الشخصية رأسها بحدة نحو اليسار، يدرك الذكاء الاصطناعي: "بناءً على زاوية الأنف، يجب أن تكون الأذن اليمنى مخفية خلف الرأس".
التشبيه: الأمر يشبه محققاً في مسرح جريمة؛ أحد المحققين ينظر عبر عدسة مكبرة إلى أثر قدم واحد (المحقق المحلي)، بينما ينظر الآخر إلى الغرفة بأكملة ليرى كيف تم ترتيب الأثاث (محقق السياق). ومن خلال دمج ملاحظاتهما، يحصلان على القصة الكاملة.
٣. "مرشح الأمان" (الفوائد اللاحقة)
لأن OccFace يصرح صراحةً بأن "أعتقد أن هذه النقطة مخفية"، فإنه يوفر "إشارة أمان" للبرامج الأخرى.
التشبيه: تخيل أنك محرك دمى (لاعب عرائس). إذا تعثر خيط من خيوط دميتك أو اختفى، فأنت لا تسحب الخيط بعشوائية وتخاطر بكسر الدمية، بل تتوقف وتدرك: "لا يمكنني رؤية هذا الخيط الآن".
ولأن OccFace يخبر الكمبيوتر أي النقاط "غير مرئية"، يمكن للكمبيوتر تجاهل تلك النقاط "المشوهة". يؤدي هذا إلى حركات أكثر سلاسة بكثير — فلا مزيد من الأفواه المتلعثمة أو العيون الطافية.
الملخص
باخت-صار، OccFace لا يحاول فقط العثور على نقاط الوجه؛ بل يتعلم فهم ما هو مرئي وما هو مخفي. وهذا يجعل الشخصيات الرقمية — من صور الـ "أفاتار" في ألعاب الفيديو المفضلة لديك إلى الروبوتات الودودة — تتحرك ببراعة وواقعية أكبر، حتى عندما يتم تغطيتها جزئياً.
OccFace هو إطار عمل مبتكر مصمم للكشف الشامل عن معالم الوجه الشبيهة بالبشر. وخلافاً للكواشف التقليدية التي تركز على الوجوه البشرية الواقعية، تم بناء OccFace للتعامل مع طيف متنوع من الكيانات "الشبيهة بالبشر"، بما في ذلك الشخصيات الرمزية (Avatars) المصممة، والشخصيات الكرتونية، والحيوانات ذات الصفات البشرية، والروبوتات.
1. المشكلة: أوجه القصور في الكواشف الحالية
حدد المؤلفون فجوتين حرجتين في أبحاث كشف معالم الوجه الحالية:
محدودية النطاق (التخطيط): تستخدم معظم النماذج الحالية تخطيطات متمحورة حول البشر (مثل 68 أو 98 نقطة)، وهي غير كافية للشخصيات المصممة. تفتقر هذه التخطيطات غالباً إلى الهياكل التعبيرية الضرورية للوجوه غير البشرية، مثل حدود الأذن، وتفاصيل الفم الداخلية، وهياكل العين الدقيقة.
تعقيد الاحتجاب: تتعامل الطرق الحالية مع الاحتجاب بشكل ضمني، حيث تواجه صعوبة في نوعين متميزين: الاحتجاب الخارجي (الشعر، الأيدي، الإكسسوارات) والاحتجاب الذاتي الناتج عن الدوران (حيث تتسبب وضعيات الرأس الكبيرة في اختفاء ملامح الجانب البعيد من الوجه). غالباً ما تفشل النماذج الحالية في التمييز بين كون المعلم "صعب الرؤية" وبين كونه "محجوباً بالفعل"، مما يؤدي إلى تطبيقات غير مستقرة في مراحل لاحقة مثل التحريك (Animation).
2. المنهجية: إطار عمل OccFace
يعتمد OccFace على هيكل خلفي قائم على خرائط الحرارة (Heatmap-based backbone) ويقدم عدة ابتكارات معمارية وإشرافية:
تخطيط موحد مكون من 100 نقطة: لضمان الاتساق عبر النطاقات المختلفة، اقترح المؤلفون مخططاً أكثر كثافة يتكون من 100 نقطة. يتضمن هذا المخطط الملامح الوجهية القياسية بالإضافة إلى مراسي العين الدقيقة (البؤبؤ/القزحية)، وهياكل الفم الداخلية، وحدود الأذن الصريحة.
خرائط الأدلة الهندسية: لمنع "انزياح" المعالم في المناطق الغامضة أو المحجوبة، يتنبأ النموذج بخرائط مساعدة لـ نقاط الخرائط (نوى غاوسية - Gaussian kernels) وخرائط الحواف (منحنيات حدود دلالية). تعمل هذه الخرائط كأدلة هندسية لإعادة وزن خرائط الحرارة للمعالم، مما يضمن تحديد الموقع بدقة واستقرار.
وحدة التنبؤ بالاحتجاب: يتنبأ النموذج صراحةً بدرجة رؤية لكل نقطة (v∈[0,1]) باستخدام نهج ذي فرعين:
الفرع المحلي: يستخدم ميزات الجوار المحلي للكشف عن المحجبات الخارجية المستقلة.
فرع سياق المعالم المتقاطعة: يشارك المعلومات عبر المعالم لالتقاط الأنماط المترابطة (على سبيل المثال، عندما يدور الرأس، يصبح الجانب البعيد من الوجه بأكمله محجوباً).
الدمج المبوّب (Gated Fusion): يقرر بوابة قابلة للتعلم (α) ديناميكياً مدى الاعتماد على السياق العالمي مقابل الأدلة المحلية.
القناع المدرك للمعالم (استراتيجية التدريب): للتغلب على ندرة تسميات الاحتجاب اليدوية، استخدم المؤلفون تقنية تعزيز اصطناعية؛ حيث طبقوا أقنعة عشوائية على الصور واستخلصوا تسميات "الرؤية الزائفة" بناءً على التداخل بين القناع وخرائط الحرارة للمعالم الحقيقية.
3. المساهمات الرئيسية
نموذج OccFace: إطار عمل موحد يتنبأ بشكل مشترك بإحداثيات 100 نقطة ودرجة رؤية كل نقطة.
مجموعة بيانات Genie-Face: مجموعة بيانات واسعة النطاق ومتنوعة تحتوي على 15,475 صورة عبر نطاقات متعددة (شخصيات رمزية، ثدييات، روبوتات، إلخ) مُوسومة بتخطيط الـ 100 نقطة والرؤية.
مجموعة تقييم مدركة للاحتجاب: مجموعة جديدة من المقاييس التي تفصل الأداء إلى NME-vis (المعالم المرئية) و NME-occ (المعالم المحجوبة)، جنباً إلى جنب مع مقاييس التصنيف (Occ AP, F1, ROC-AUC) لدقة الرؤية.
4. النتائج والأهمية
متانة فائقة: تظهر التجار تجري على مجموعة بيانات Genie-Face أن OccFace يتفوق بشكل كبير على النماذج الرائدة (مثل ORFormer) في كل من دقة التحديد والتنبؤ بالرؤية. وهو يتميز تحديداً في تقليل الخطأ في المناطق المحجوبة (NME-occ) مع الحفاظ على دقة عالية في المناطق المرئية.
رؤى الاستئصال (Ablation Insights): تؤكد الدراسة أن الخرائط الهندسية المساعدة حيوية للاستقرار، وأن رأس الرؤية ثنائي الفرع ضروري لالتقاط الطبيعة الهيكلية للاحتجاب الذاتي.
المنفعة في التطبيقات اللاحقة: أظهر المؤلفون أن إشارة الرؤية الصريحة تحسن مباشرة من تحريك الشخصيات (Avatar Animation). فمن خلال استخدام درجات الرؤية لتصفية أو وزن المعالم، حققوا حركة وجهية أكثر سلاسة واستقراراً مع تقليل الارتعاش (Jitter) بشكل كبير مقارنة بالطرق التقليدية.
الأهمية: ينقل OccFace كشف معالم الوجه من مهمة "مقتصرة على البشر" إلى مهمة "شاملة للكيانات الشبيهة بالبشر"، مما يوفر أساساً قوياً لمجال البشر الرقميين المتنامي، والألعاب، وتحريك الشخصيات.