← أحدث الأبحاث
💻 computer science

From Action Units to Emotions: A Two-Stage Fine-Tuning Framework with Decision-Level Fusion for Facial Expression Recognition

تقترح هذه الورقة إطار عمل للضبط الدقيق على مرحلتين يعزز قدرات نموذج لغوي كبير متعدد الوسائط في التعرف على وحدات الحركة الوجهية وتصنيف المشاعر من خلال مجموعة بيانات سؤال-جواب والدمج على مستوى القرار مع نموذج صغير متخصص، مما يؤدي إلى تحسين دقة وقابلية تفسير التعرف على التعبيرات الوجهية للتعبيرات الدقيقة ومنخفضة الكثافة بشكل كبير.

المؤلفون الأصليون: Rui Tu, Liguo Zhou, Alois Knoll

نُشر 2026-08-31
📖 1 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Rui Tu, Liguo Zhou, Alois Knoll

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

ملخص تقني: من وحدات الحركة إلى العواطف

بيان المشكلة

لا تزال عملية التعرف على تعبيرات الوجه (FER) مقيدة بتحديات عملية مثل تغيرات الإضاءة، واختلافات الوضعية، وندرة البيانات المشروحة. غالبًا ما تعاني نماذج التعلم العميق الحالية من ضعف القدرة على التكيف مع النطاقات المختلفة، والفرط في التخصيص (overfitting)، وعدم كفاية القابلية للتفسير. علاوة على ذلك، بينما توفر النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) فهمًا دلاليًا متقدمًا، إلا أنها تفتقر في كثير من الأحيان إلى الحساسية اللازمة لإدراك التشوهات الهندسية الدقيقة للوجه وتعبيرات الوجه الدقيقة (micro-expressions). كما أن الضبط الدقيق التقليدي لنهاية إلى نهاية (end-to-end) للنماذج اللغوية الكبيرة متعددة الوسائط على إشارات "الفيديو-التسمية" غالبًا ما يهمل التمثيلات الوسيطة دقيقة التفاصيل (وحدات الحركة - Action Units) التي تكمثل أساس التعبيرات العاطفية، مما يؤدي إلى سلاسل استدلال غير مثالية.

المنهجية

يقترح البحث إطار عمل للضبط الدقيق على مرحلتين مع الدمج على مستوى القرار، مصمم لسد الفجوة بين الإدراك الوجهي منخفض المستوى والدلالات العاطفية عالية المستوى.

1. الضبط الدقيق التدريجي على مرحلتين

تعتمد الاستراتيجية الجوهرية على تفكيك التعرف على تعبيرات الوجه إلى مرحلتي تعلم متتاليتين لتحقيق "الفصل الثلاثي": الفصل بين الإدراك والاستدلال، والمعرفة المستقلة عن النطاق مقابل المعرفة الخاصة بالنطاق، والملاحظات الفيزيائية مقابل تسميات العواطف.

  • المرحلة الأولى: الضبط الدقيق لكشف وحدات الحركة (الإدراك)

    • البيانات: يستخدم مجموعة بيانات CAS(ME)³، التي توفر تسميات لوحدات الحركة (AU) على مستوى الإطار.
    • المهمة: إعادة صياغة التعرف على وحدات الحركة كمسألة إجابة على الأسئلة البصرية (VQA). يتم توجيه النموذج لتحديد وحدات الحركة النشطة بناءً على المدخلات البصرية، بالاستفادة من المعرفة المسبقة بنظام ترميز حركة الوجه (FACS).
    • النموذج: يتم ضبط نموذج Qwen3-VL-32B-Instruct متعدد الوسائط باستخدام تقنية LoRA (التكيف منخفض الرتبة) لتحديث مجموعة فرعية صغيرة فقط من المعلمات (مصفوفات الاستعلام والقيمة)، مما يحافظ على المعرفة البصرية-الدلالية المسبقة مع تعلم كشف وحدات الحركة.
    • الهدف: تأسيس قدرات إدراكية قوية ومستقلة عن النطاق لحركات الوجه الدقيقة.
  • المرحلة الثانية: الضبط الدقيق للتعرف على التعبيرات (الاستدلال)

    • البيانات: الانتقال إلى مجموعة بيانات FER-2013 (صور ثابتة مع تسميات عاطفية ولكن بدون تسميات وحدات الحركة).
    • المهمة: يتم نقل الأوزان من المرحلة الأولى لضبط النموذج بشكل أكبر لربط مجموعات وحدات الحركة المكتشفة بفئات العواطف. يتطلب تنسيق المخرجات من النموذج الاستدلال من وحدات الحركة وصولاً إلى تسمية العاطفة النهائية، مع الحفاظ على هيكلية الـ VQA.
    • الاستراتيجية: يتم تحسين محولات LoRA الجديدة فقط الخاصة بالتعرف على العواطف؛ بينما يظل المشفر البصري ومحولات المرحلة الأولى مجمدة للحفاظ على سلسلة الاستدلال من وحدات الحركة إلى العاطفة.

2. الدمج على مستوى القرار

لمعالجة قيود النماذج الكبيرة الصرفة في إدراك التشوهات الهندسية دقيقة التفاصيل، يدمج إطار العمل نموذج Qwen3-VL الذي تم ضبطه بدقة مع OpenFace 3.0، وهو نموذج متخصص وخفيف الوزن يعتمد على الشبكات العصبية التلافيفية (CNN) للتعرف على تعبيرات الوجه.

  • الآلية: يقوم إطار العمل بدمج التوزيعات الاحتمالية (PVLMP_{VLM} و POpenFaceP_{OpenFace}) للنموذجين عبر استكمال خطي مرجح:
    Pfinal=αPOpenFace+(1α)PVLMP_{final} = \alpha \cdot P_{OpenFace} + (1 - \alpha) \cdot P_{VLM}
  • الأساس المنطقي: يوفر OpenFace 3.0 الحساسية للمعالم الوجهية المحلية والسمات الهندسية، بينما يوفر النموذج اللغوي الكبير (MLLM) المضبط دقة دلالية عالية وسياقًا استدلاليًا.

المساهمات الرئيسية

  1. التحقق من صحة النماذج المرجعية للنماذج الكبيرة: تقييم أداء التعلم الصفري (zero-shot) والتعلم القليل (few-shot) لنموذج Qwen3-VL-32B-Instruct على التعرف على تعبيرات الوجه، مما وضع خط أساس قوي.
  2. الضبط الدقيق على مرحلتين الموجه بوحدات الحركة (AU): تقديم نموذج تعلم منهجي حيث يتعلم النموذج أولاً كشف وحدات الحركة على CAS(ME)³ قبل رسم الخرائط نحو العواطف على FER-2013. وهذا يُمكّن النموذج من اكتساب قدرات الاستدلال لوحدات الحركة والاستدلال عبر سلسلة قابلة للتفسير ("استدلال وحدة الحركة أولاً، ثم التنبؤ بالعاطفة ثانياً").
  3. التعاون بين النماذج غير المتجانسة: إثبات جدوى الدمج على مستوى القرار بين نموذج لغوي كبير متعدد الوسائط ونموذج صغير متخصص (OpenFace 3.0)، مما يؤكد نقاط القوة المتكاملة لكل منهما.
  4. أداء تجريبي قوي: أظهر الإطار المقترح تفوقًا ملحوظًا على النماذج المرجعية غير المضبطة والنماذج المتخصصة المستقلة، لا سيما في تحسين الاستدعاء (recall) للفئات الأقلية وتعزيز القابلية للتفسير.

النتائج التجريبية

أُجريت التجارب على مجموعة اختبار FER-2013 باستخدام مقاييس تشمل الدقة (ACC)، والضبط (Precision)، والاستدعاء (Recall)، ودرجة F1 (F1-Score).

  • الأداء مقابل النماذج المرجعية:
    • حقق نموذج Qwen3-VL المضبط دقة بلغت 66.73%، بزيادة قدرها 8 نقاط مئوية عن النموذج المرجعي غير المضبط (58.73%).
    • حقق النموذج المدمج (Qwen3-VL + OpenFace 3.0) دقة بلغت 67.37%.
    • مقارنة بالشبكات العصبية التلافيفية التقليدية، يتفوق النموذج المدمج قليلاً على GoogLeNet (67.04%) ولكنه يتراجع خلف ResNet-50 (69.33%)، وVGG-16 (68.75%)، وDenseNet (69.38%).
    • رغم عدم تجاوز أفضل نماذج CNN المتخصصة في الدقة الإجمالية، أظهر النموذج المدمج دقة موزونة (Weighted Precision) متفوقة (69.47%)، وهي نسبة مقاربة لنموذج ResNet50 (69.84%).
  • مزايا الدمج:
    • أظهر النموذج المدمج تحسنًا كبيرًا في الاستدعاء الكلي (Macro-Recall) (62.71%) مقارنة بالنموذج الكبير الصرف (58.64%)، مما يشير إلى قدرة أفضل على التقاط الفئات الأقلية (مثل الاشمئزاز والخوف).
    • مقارنة بنموذج OpenFace 3.0 وحده (دقة 48.02%)، حسن الإطار المشترك الدقة بمقدار 19.35 نقطة مئوية (تحسن نسبي بنسبة 40.3%).
  • القابلية للتفسير: نجح النموذج في توليد تفسيرات باللغة الطبيعية تربط تنشيطات وحدات الحركة المحددة (مثل AU4، AU7) بأحكام العواطف، مما وفر سلسلة استدلال قابلة للتتبع غائبة في نماذج CNN التي تُعد "صناديق سوداء".

الأهمية والادعاءات

يدعي البحث أن استراتيجية الضبط الدقيق على مرحلتين تنجح في استخراج ميزات تمييزية للتشوهات الهندسية الوجهية الدقيقة والتعبيرات منخفضة الكثافة من النماذج البصرية الكبيرة، والتي عادة ما تعاني مع هذه التفاصيل الدقيقة.

يؤكد المؤلفون أنه بينما تمتلك النماذج البصرية الكبيرة الصرفة فهمًا دلاليًا عالي المستوى هائلًا، إلا أنها تظهر قيودًا متأصلة في إدراك التشوهات الوجهية الدقيقة. ويعالج الأسلوب المقترح ذلك من خلال:

  1. تعزيز القابلية للتفسير: استخدام وحدات الحركة (AUs) كتمثيلات وسيطة يسمح بمخرجات نموذج قابلة للتتبع، مما يزيد من الموثوقية.
  2. تحسين المتانة: يعوض الدمج على مستوى القرار نقص المعالم المكانية الدقيقة في النماذج الكبيرة، مما يعزز بشكل كبير الأداء في الفئات الأقلية ويقلل الانحياز نحو الفئات الأكثر شيوعًا.
  3. توفير مسار جديد: تقدم الدراسة نموذجًا تقنيًا لبناء أنظمة تعرّف على تعبيرات الوجه قوية للغاية وقابلة للتفسير من خلال الاستفادة من نقاط القوة المتكاملة للنماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) والنماذج الهندسية المتخصصة، وهو ما أثبتته النتائج التجريبية التي أظهرت مكاسب جوهرية على الاستدلال المستقل لأي من نوعي النماذج.

يخلص المؤلفون إلى أنه على الرغم من أن الدقة الحالية لا تتفوق بعد على أفضل نماذج CNN المتخصصة، إلا أن الإطار يظهر تفوقًا واضحًا في الثقة في التنبؤ، والقابلية للتفسير الهيكلي، وإمكانات التطبيقات التآزرية للنماذج الكبيرة في مجال الحوسبة الوجدانية (affective computing).

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →