Automated Detection of Mutual Gaze and Joint Attention in Dual-Camera Settings via Dual-Stream Transformers
تقدم هذه الورقة بنية "ترانسفورمر" (Transformer) ثنائية المسار وفعالة تعمل على أتمتة اكتشاف التحديق المتبادل والانتباه المشترك في تسجيلات الكاميرا المزدوجة بين مقدم الرعاية والرضيع، متفوقة بشكل كبير على النماذج المرجعية الحالية وموفرةً أداة مفتوحة المصدر وقابلة للتوسع لأبحاث علم نفس النمو.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول فهم محادثة بين طفل رضيع ووالديه. في عالم علم نفس النمو، هناك لحظتان مهمتان للغاية: التواصل البصري المتبادل (عندما ينظران مباشرة في أعين بعضهما البعض) والانتباه المشترك (عندما ينظر كلاهما إلى نفس اللعبة أو الشيء).
لعقود من الزمن، كانت دراسة هذه اللحظات تشبه محاولة عد حبات الرمل باستخدام عدسة مكبرة. كان على الباحثين الجلوس أمام تسجيلات الفيديو، ومشاهدتها بالعرض البطيء، والنقر يدوياً على زر في كل مرة ينظر فيها الطفل والوالد إلى بعضهما البعض أو إلى نفس الشيء. كان الأمر بطيئاً، ومرهقاً، وعرضة للخطأ البشري.
تقدم هذه الورقة البحثية "مساعداً رقمياً" يقوم بهذه المهمة تلقائياً، وهو يؤديها بشكل أفضل بكثير من المحاولات السابقة. إليك كيف يعمل، مشروحاً ببساية:
المشكلة: لغز "الكاميرتين"
قام الباحثون بإعداد غرفة بها كاميرتان: واحدة تركز على الطفل والأخرى على الوالد. لمعرفة ما إذا كانا يتشاركان الانتباه، يحتاج الكمبيوتر إلى فهم شيئين في آن واحد:
- إلى ماذا ينظر الطفل؟
- إلى ماذا ينظر الوالد؟
- هل هذان الشيئان مرتبطان؟
البرامج الحاسوبية السابقة كانت مثل الطلاب الذين يحاولون حل مسألة رياضية عبر النظر إلى رقم واحد فقط في كل مرة. لقد واجهوا صعوبة في ربط النقاط بين عرضي الكاميرا المختلفين.
الحل: "عقل ثنائي المسار"
بنى المؤلفون نظام ذكاء اصطناعي جديد يسمى المحول ثنائي المسار (Dual-Stream Transformer). فكر في هذا النظام كأنه محقق ماهر يمتلك زوجين من العيون وعقلاً خارقاً في المنتصف.
- العينان (النماذج الأساسية): يمتلك النظام "عينين" (شبكات عصبية) تراقب تدفقات الفيديو. عين تراقب الطفل، والأخرى تراقب الوالد.
- السر الخفي: هاتان العينان لا تبدآن من الصفر؛ فهما تستخدمان "أدمغة" مدربة مسبقاً ومجمدة (تسمى GazeLLE) تعلمت بالفعل كيفية رصد اتجاه نظر الشخص. الأمر يشبه إعطاء المحقق نظارات عالية التقنية تعرف بالفعل كيفية تتبع العيون بدقة.
- العقل الخارق (المحول - Transformer): بمجرد أن تجمع العينان المعلومات، تمررانها إلى "عقل" مركزي (المحول). هذا العقل لا ينظر إلى الطفل أو الوالد بشكل منفصل فحسب؛ بل ينظر إليهما معاً. يتساءل: "حسناً، الطفل ينظر إلى المكعب الأحمر، والوالد ينظر إلى المكعب الأحمر. هل هذا انتباه مشترك؟ أم أن الطفل ينظر إلى الوالد بينما ينظر الوالد إلى الطفل؟ هل هذا تواصل بصري متبادل؟"
- دمج الرموز (Token Fusion): يستخدم النظام "لاصقاً" خاصاً (يسمى آلية دمج الرموز) لدمج منظوري الكاميرا معاً حتى يتمكن العقل من فهم العلاقة بينهما.
التدريب: التعلم من الحياة الواقعية
لم يستخدم الفريق فيديوهات وهمية، بل سجلوا أطفالاً ووالدين حقيقيين يلعبون في مختبر.
- البيانات: كان لديهم 13 زوجاً مختلفاً من (الأب/الأم والطفل) يلعبون لمدة سبع جلسات لكل منهم تقريباً.
- اللمسة البشرية: قبل أن يتمكن الذكاء الاصطناعي من التعلم، كان على خبراء بشريين مشاهدة الفيديوهات وتحديد اللحظات الخاصة بدقة. ولتسهيل ذلك، بنى الفريق أداة فيديو مخصصة سمحت لهم بتصنيف الأحداث بسرعة.
- النتيجة: تعلم الذكاء الاصطعي التعرف على هذه الأنماط من خلال مشاهدة آلاف هذه اللحظات المصنفة.
المواجهة: كيف كان الأداء؟
اختبر الباحثون "المحقق ثنائي المسار" الجديد ضد طريقتين أخريين:
- الطريقة التقليدية (الشبكة التلافيفية - Convolutional Network): وهي تشبه كاميرا قياسية تبحث عن الأنماط لكنها لا "تفهم" حقاً العلاقة بين شخصين. لقد فشلت هذه الطريقة فشلاً ذريعاً، ولم تكن أفضل من التخمين العشوائي.
- النموذج اللغوي الكبير (LLM): وهو ذكاء اصطناعي ضخم وعام الأغراض (مثل روبوت دردشة ذكي جداً يمكنه الرؤية). ورغم ذكائه، إلا أنه كان بطيئاً جداً وغالباً ما يخطئ في التخمين لأنه لم يكن متخصصاً لهذه المهمة المحددة.
الفائز: فاز المحول الجديد (Dual-Stream Transformer) بفارق كبير.
- كان أكثر دقة بكثير (حقق حوالي 82% من الصحة في التواصل البصري المتبادل و77% في الانتباه المشترك).
- كان أسرع بكثير. فبينما استغرق النموذج اللغوي الكبير وقتاً طويلاً لمعال gereken بضع ثوانٍ من الفيديو، استطاع النظام الجديد معالجة الفيديو بشكل شبه فوري.
لماذا يهم هذا؟
لم يبنِ المؤلفون مجرد نموذج، بل بنوا أداة للعلماء.
- مفتوح المصدر: لقد أطلقوا الكود البرمجي وأوزان "الدماغ" مجاناً. وهذا يعني أن المختبرات الأخرى يمكنها أخذ هذه الأداة، وتعديلها قليلاً لتناسب غرفهم الخاصة، والبدء في تحليل البيانات دون الحاجة لبناء نظام من الصفر.
- القابلية للتوسع: نظرًا لكونه سريعاً ودقيقاً، يمكن لعلماء النفس الآن تحليل ساعات من الفيديو في دقائق بدلاً من أيام.
العقبات (القيود)
الورقة البحثية صريحة بشأن ما لا يستطيع النظام فعله بعد:
- يحتاج إلى وجه: يعتمد النظام على أداة منفصلة للعثور على الوجوه أولاً. إذا لم تستطع الكاميرا رؤية الوجه (ربما بسبب اختباء الطفل)، فلن يتمكن النظام من تخمين اتجاه النظر.
- بطيء نوعاً ما في الوقت: يقوم النظام بفحص الفيديو مرة كل ثانية. قد يفوت هذا الأمر النظرات السريعة جداً التي تحدث في أجزاء من الثانية.
- إنه متخصص: تم تدريبه على 13 عائلة محددة. ورغم أنه يعمل جيداً، إلا أنه قد يحتاج إلى القليل من "الضبط الدقيق" إذا استُخدم في غرفة مختلفة تماماً ذات إضاءة أو زوايا كاميرا مختلفة.
باختصار: تقدم هذه الورقة البحثية لعلماء السلوك "مساعداً آلياً" قوياً وسريعاً ومجانياً، يمكنه مشاهدة فيديوهات الوالدين والأطفال وتحديد لحظات التواصل السحرية فوراً، مما يوفر عليهم ساعات من العمل اليدوي الممل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.