← أحدث الأبحاث
💻 computer science

SSRNet: Robust Facial Expression Representation Learning Using Structure Prior and Self-Supervised Regularization

تقترح الورقة البحثية SSRNet، وهو إطار عمل قوي للتعرف على تعبيرات الوجه يجمع بين وحدة تعزيز الميزات الموجهة بالأولوية الهيكلية والتعلم التبايني ذاتي الإشراف لمعالجة تحديات العالم الحقيقي مثل الضجيج والانسداد بفعالية، محققاً أداءً هو الأفضل في فئته على مجموعتي بيانات FER2013 وRAF-DB.

المؤلفون الأصليون: Jing Li, Wenjuan Gu, Junxiang Peng, Xingzheng Xiao, Haijin Xu

نُشر 2026-09-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jing Li, Wenjuan Gu, Junxiang Peng, Xingzheng Xiao, Haijin Xu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في الزوايا الهادئة لرؤية الحاسوب، ظل تحدٍ محدد طويلاً يمنع الآلات من فهم المشاعر الإنسانية حقاً: وهو فوضى الحياة الواقعية. فبينما يمكن للحواسيب التعرف بسهولة على وجه في صورة ملتقطة في استوديو بإضاءة مثالية، فإنها غالباً ما تتعثر عندما يكون نفس الوجه ملتفتاً جانباً، أو مخفياً جزئياً بيد، أو مضاءً بضوء قاصٍ وغير متساوٍ. ويتفاقم هذا الصعوبة بسبب البيانات المستخدمة لتعليم هذه الأنظمة؛ فالصور التي تدرب الذكاء الاصطناعي غالباً ما يتم تصنيفها بواسطة البشر، والبشر يرتكبون الأخطاء. قد يختلفون حول ما إذا كان التكشير تعبيراً عن الغضب أم الاشمئزاز، أو قد يصنفون صورة ما بشكل خاطئ تماماً. وعندما يتعلم الحاسوب من هذه التعليمات غير المكتملة، فإنه يميل إلى حفظ الأخطاء بدلاً من الحقيقة، مما يؤدي إلى نماذج هشة وغير موثوقة خارج المختبر. إن الهدف من التعرف على تعبيرات الوجه ليس مجرد تحديد الابتسامة أو العبوس، بل بناء نظام يمكنه رؤية التحولات الطفيفة والعابرة في حركة العضلات التي تحدد مشاعرنا، حتى عندما تكون الصورة مشوشة والتصنيفات خاطئة.

ولمعالجة هذه المشكلة، طور الباحثون "جينغ لي" وفريقها في جامعة كونمينغ للعلوم والتكنولوجيا نهجاً جديداً يسمى SSRNet. فبدلاً من محاولة إجبار الحاسوب على تعلم كل شيء من الصفر، بنوا نظاماً يجمع بين استراتيجيتين متميزتين: إحداهما تعلم الآلة النظر إلى الأجزاء الصحيحة من الوجه، والأخرى تعلمها أن تثق في الأنماط البصرية التي تراها، حتى عندما تكون التصنيفات مربكة. بدأ الفريق بهيكل أساسي قياسي وموثوق لرؤية الحاسوب وأضاف طبقة توجيه قائمة على التشريح البشري. فقد أدركوا أن مناطق معينة من الوجه — العينان، والحواجب، والأنف، والفم — هي الأماكن التي تُكتب فيها المشاعر بوضوح أكبر. لذا، أنشأوا وحدة تبرز هذه المناطق صراحةً، وتخبر الشبكة بأن تولي اهتماماً إضافياً لقطع الجلد المحددة حيث يتشكل العبوس أو تنتشر الابتسامة. هذه ليست خريطة معقدة ومتغيرة؛ بل هي دليل ثابت يضمن ألا يفقد النظام رؤية الملامح الأكثر تعبيراً، بغض النظر عن وضعية الوجه أو مدى تشتت الخلفية.

ومع ذلك، فإن التركيز على المواضع الصحيحة هو نصف المعركة فقط. فقد احتاج الباحثون أيضاً إلى ضمان قدرة النظام على التعامل مع الارتباك الناتج عن التصنيفات غير الصحيحة. ولتحقيق ذلك، قدموا فرعاً للتنظيم ذاتي الإشراف. تخيل طالباً يدرس لاختبار ما ولكنه يمتلك كتاباً مليئاً بالأخطاء المطبعية. إذا قرأ الطالب فقط الإجابات الموجودة في نهاية الكتاب، فسوف يتعلم الأخطاء. ولكن إذا مارس الطالب أيضاً المقارنة بين صور مختلفة لنفس المفهوم ليرى ما يظل ثابتاً، فيمكنه تعلم الحقيقة الأساسية بغض النظر عن الأخطاء المطبعية. وبالمثل، ينظر هذا الجزء من النظام إلى نسخ مختلفة من نفس الوجه ويتعلم التعرف على أنها نفس الشخص الذي يعبر عن نفس الشعور، حتى لو كان التصنيف الملحق بالصورة خاطئاً. ومن خلال إجبار الحاسوب على إيجال الاتساق داخل الصور نفسها، يصبح النظام أقل اعتماداً على التصنيفات البشرية التي قد تكون معيبة وأكثر تركيزاً على الأدلة البصرية الفعلية.

تم اختبار نتائج هذا النهج المزدوج على مجموعتي بيانات كبيرتين من الواقع العملي والمعروفتين بالتعقيد والضجيج. ففي مجموعة بيانات FER2013، التي تحتوي على آلاف الصور الملتقطة في بيئات غير منضبطة، حقق النظام الجديد دقة بلغت 72.51 بالمائة. وفي مجموعة بيانات RAF-DB، وهي مجموعة أخرى من الصور المستمدة من الإنترنت ذات الإضاءة والزوايا المتنوعة، وصل إلى 85.09 بالمائة. كانت هذه الأرقام أعلى مما حققته عدة طرق رائدة أخرى، مما يشير إلى أن الجمع بين التوجيه التشريحي والتصحيح الذاتي يعمل بشكل جيد. كما اختبر الباحثون مدى صمود النظام عندما أضافوا عمداً المزيد من الأخطاء إلى بيانات التدريب. وحتى عندما كانت 40 بالمائة من التصنيفات خاطئة، حافظ النظام الجديد على ميزة واضحة على النماذج القديمة، مما أثبت أنه تعلم تجاهل الضجيج والتركيز على الإشارة.

عندما قام الفريق بتصور كيفية رؤية الحاسوب للعالم، كان الفرق صارخاً. كانت النماذج القديمة تميل إلى تجميع المشاعر المختلفة معاً في سحابة فوضوية، وتكافح للتمييز بين الخوف والمفاجأة أو الحزن والحياد. أما النظام الجديد، فقد نظم هذه المشاعر في مجموعات متميزة وضيقة. لقد تعلم فصل الاختلافات الدقيقة التي تحدد شعوراً معيناً، وخلق حدوداً واضحة بينها. يشير هذا إلى أنه من خلال تعليم الحاسوب النظر في الأماكن الصحيحة والتحقق من ملاحظاته، يمكن للنظام بناء فهم أكثر استقراراً ودقة للمشاعر الإنسانية. لا يدعي هذا العمل حل كل المشكلات؛ فلا يزال النظام يعتمد على خرائط محددة مسبقاً للوجه، والتي قد تواجه صعوبة إذا كان الشخص محجوباً بشكل كبير أو ملتفتاً بزاوية حادة. ومع ذلك، فإنه يقدم مساراً واعداً لبناء آلات يمكنها قراءة وجوهنا بنفس المرونة والدقة التي نستخدمها نحن لقراءة بعضنا البعض، حتى في ضوء الواقع غير المثالي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →