← أحدث الأبحاث
🤖 machine learning

Attention-Guided Dual-Stream Learning for Group Engagement Recognition: Fusing Transformer-Encoded Motion Dynamics with Scene Context via Adaptive Gating

تقترح هذه الورقة DualEngage، وهو إطار عمل ثنائي المسار مبتكر يدمج ديناميكيات الحركة الفردية المشفرة عبر المحولات (transformer-encoded) مع السياق الزماني المكاني على مستوى المشهد عبر بوابات تكيفية لتحقيق دقة عالية في التعرف على التفاعل الجماعي في فيديوهات الفصول الدراسية.

المؤلفون الأصليون: Saniah Kayenat Chowdhury, Muhammad E. H. Chowdhury

نُشر 2026-04-14
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Saniah Kayenat Chowdhury, Muhammad E. H. Chowdhury

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل فصلاً دراسياً مزدحماً كأنه أوركسترا صاخبة. بعض الطلاب يعزفون على آلاتهم بشغف (مشاركة عالية)، وبعضهم يكتفي بالنقر بأقدامهم بين الحين والآخر (مشاركة متوسطة)، وآخرون غارقون في أحلام اليقظة أو ينظرون من النافذة (مشاركة منخفضة).

لفترة طويلة، حاول المعلمون وأجهزة الكمبيوتر معرفة من ينتبه. معظم الأنظمة كانت تراقب موسيقياً واحداً في كل مرة، وتتحقق مما إذا كانت عيناه مفتوحتين أو إذا كان يهز رأسه. ولكن في بيئة جماعية، لا تكمن السحر في الفرد فحسب، بل في طاقة الغرفة بأكملها. فأحياناً يكون الفصل بأكمله صامتاً وساكناً، لكن الجميع في حالة تركيز عميق. وفي أحيان أخرى، يتحرك الطلاب كثيراً، لكنهم لا يتعلمون حقاً.

تقدم هذه الورقة نظاماً جديداً يسمى DualEngage (Dual تعني اثنان). الأمر يشبه استئجار محققين مختلفين لحل لغز "من هو المتفاعل؟"، ثم جعلهما يقارنان ملاحظاتهما قبل اتخاذ قرار نهائي.

المحققان الاثنان (المساران)

المحقق رقم 1: "متتبع الحركة" (المسار الأساسي)

  • ماذا يفعل: يركز هذا المحقق على كل طالب على حدٍ. هو لا يكتفي بمراقبة الوجوه، بل يراقب كيفية تحرك الناس. يستخدم أداة خاصة (تسمى Optical Flow) تعمل مثل "مستشعر رياح" للبكسلات؛ حيث يرى التحركات الطفيفة في الوضعية، أو التململ، أو الميل للأمام، أو دوران الرأس.
  • القوة الخارقة: يستخدم "Transformer" (تخيله كبنك ذاكرة فائق الذكاء) ليتذكر كيف تحرك الطالب بمرور الوقت. هل مال للأمام في بداية المحاضرة واستمر على ذلك؟ أم بدأ بالتململ بعد خمس دقائق؟
  • المشكلة: أحياناً، يكون الطالب ساكناً تماماً لأنه في حالة تركيز شديد. إذا اكتفى هذا المحقق بمراقبة الحركة فقط، فقد يظن: "أوه، لا توجد حركة يعني لا يوجد تفاعل!"، وهذا سيكون خطأً.

المحقق رقم 2: "خبير أجواء الغرفة" (المسار الثانوي)

  • ماذا يفعل: يتراجع هذا المحقق خطوة إلى الوراء وينظر إلى الفصل الدراسي بأكم كصورة واحدة كبيرة. هو لا يهتم بالطلاب الأفراد، بل يهتم بـ "طاقة المجموعة".
  • القوة الخارقة: يستخدم عقلاً كاميرا ثلاثي الأبعاد (3D ResNet) لرصد أنماط مثل: هل يميل الفصل بأكمله للأمام معاً؟ هل ينظر الجميع إلى المعلم؟ هل الغرفة متناغمة؟
  • المشكلة: قد يغفل هذا المحقق عن الطالب الهادئ في الخلف الذي هو في الواقع الأكثر تركيزاً، لأنه يركز أكثر من اللازم على الصورة الكبيرة.

المدير الذكي: "الدمج ذو البوابة" (Gated Fusion)

هذا هو الجزء العبقري. في الماضي، كانت أجهزة الكمبيوتر تأخذ ملاحظات كلا المحققين وتدمجهما معاً بالتساوي. لكن هذا يشبه سؤال خبير أرصاد جوية وشرطي مرور ليقررا ما إذا كان يجب عليك ارتداء معطف، دون السماح لهما بالتحدث مع بعضهما أولاً.

يحتوي DualEngace على مدير ذكي (يسمى Softmax-Gated Fusion).

  • كيف يعمل: ينظر المدير إلى الموقف الحالي ويسأل: "أي محقق هو الأكثر موثوقية الآن؟"
    • السيناريو (أ): الغرفة فوضوية، والطلاب يتحركون كثيراً. يقول المدير: "حسناً، المحقق رقم 1 (الحركة) يقوم بعمل رائع. دعونا نستمع إليه أكثر".
    • السيناريو (ب): الغرفة هادئة وساكنة. يقول المدير: "المحقق رقم 1 مرتبك لأن الجميع ساكنون. لكن المحقق رقم 2 (أجواء الغرفة) يرى أن الجميع ينظرون إلى السبورة في وقت واحد. دعونا نثق في أجواء الغرفة أكثر!"

يقوم المدير بتعديل "مستوى صوت" كل محقق ديناميكياً بناءً على ما يحدث في الفيديو.

النتائج: وقفة تصفيق

اختبر الباحثون هذا النظام على فيديوهات حقيقية لفصول دراسية تضم مجموعات من الطلاب.

  • النتيجة: لقد أصاب الهدف بنسبة 96% من المرات.
  • لماذا هذا مهم: واجهت الأنظمة السابقة صعوبة عندما يكون الطلاب هادئين أو عندما تكون زاوية الكاميرا صعبة. لقد أدرك هذا النظام أن "السكون" يمكن أن يعني "التركيز" إذا كانت المجموعة بأكملها متناغمة، وأن "الحركة" يمكن أن تعني "تشتتاً" إذا كانت المجموعة غير متناغمة.

الخلايد الخلاصة

فكر في DualEngage كمعلم يمتلك قوة خارقة: يمكنه مراقبة لغة جسد كل طالب على حدٍ، وفي نفس الوقت الشعور بطاقة الغرفة بأكملها. إنه يعرف متى يركز على الفرد ومتى يركز على المجموعة.

من خلال الجمع بين الحركة الفردية (كيف تتحرك) وسياق المجموعة (كيف تشعر الغرفة) واستخدام مفتاح ذكي لتحديد أيهما أكثر أهمية في أي لحظة، استطاع هذا النظام أخيراً فهم الواقع المعقد، الفوضوي، والجميل لفصل دراسي حقيقي. إنها خطوة كبيرة نحو مساعدة المعلمين على معرفة متى يتعلم طلابهم حقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →