HAP: A Hand-Driven Active Perception Framework for Egocentric Head Motion Prediction
تقدم هذه الورقة HAP، وهو إطار عمل للإدراك النشط الموجه باليد يتنبأ بحركة الرأس من منظور الشخص الأول مستقبلاً عبر استنتاج ثقة الهدف ونمذجة حالات الحجب الديناميكية عبر رسم بياني تنبؤي، وقد تم التحقق من صحته بواسطة مجموعة بيانات جديدة تسمى Bottle وأداء متفوق على النماذج المرجعية الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
عندما نشاهد شخصاً يمد يده نحو كوب، فإن أعيننا لا تكتفي بمجرد تتبع اليد؛ بل تتوقع المكان الذي ستذهب إليه اليد وتتحرك لإبقاء الهدف في رؤية واضحة. هذا هو جوهر الإدراك النشط: الفكرة القائلة بأن الاستشعار ليس مجرد تسجيل سلبي للعالم، بل هو عملية نشطة حيث نحرك أجسادنا لجمع المعلومات المحددة التي نحتاجها. وفي سياق الروبوتات أو الذكاء الاصطناعي الذي يحاول فهم السلوك البشري، يخلق هذا لغزاً صعباً. فمعظم الأنظمة جيدة في التنبؤ بالمكان الذي ستذهب إليه اليد تالياً، لكنها غالباً ما تفشل في التنبؤ باتجاه دوران رأس الشخص. إن الروبوت الذي يتتبع اليد فقط قد يغفل عن حقيقة أن الشخص على وشك الالتفات حول زاوية ما ليرى ما يمسكه، مما يؤدي إلى تفاعل مرتبك أو فاشل. إن فهم كيفية تحرك الرأس للكشف عن الأشياء المخفية لا يقل أهمية عن معرفة مكان حركة اليد، لأن اتجاه الرأس يحدد ما هي الأدلة البصرية التي سيحصل عليها الشخص تالياً.
قام فريق من الباحثين في جامعة شانغهاي جياو تونغغ وجامعة الصين للتعدين والتكنولوجيا بتطوير طريقة جديدة لحل هذه المشكلة. لقد أنشأوا نظاماً يسمى HAP، وهو اختصار لـ "إطار الإدراك النشط المدفوع باليد" (Hand-Driven Active Perception). وبدلاً من معاملة الرأس كجزء ثانوي من الجسم يتبع اليد فحسب، يعامل نظام HAP الرأس كأداة لجمع المعلومات. يعمل النظام من خلال مراقبة يد الشخص أثناء وصوله نحو الأشياء ثم تخمين الشيء الذي ينوي لمسه. ولا يتوقف الأمر عند هذا الحد؛ بل يحسب أيضاً كيف يمكن أن يكون ذلك الشيء مخفياً أو محجوباً بواسطة عناصر أخرى في المشهد. ومن خلال الجمع بين التخمين بشأن الهدف وخريطة لما هو مرئي حالياً وما قد يصبح مرئياً، يمكن للنظام التنبؤ بدقة بكيفية دوران رأس الشخص لإبقاء عينيه على هدفه.
لبناء واختبار هذه الفكرة، كان على الباحثين أولاً إنشاء مجموعة جديدة من بيانات الفيديو. لقد سجلوا مئات المقاطع القصيرة لأشخاص يمدون أيديهم نحو أشياء على طاولة، ملتقطين المشهد بكاميرات ترى الألوان والعمق معاً. في هذه الفيديوهات، تظل الأشياء ثابتة، لكن رؤية الهدف تتغير مع حركة الشخص، مما يجبر الشخص على تغيير نظره لرؤية ما يفعله. هذه المجموعة من البيانات، التي أطلقوا عليها اسم "Bottle"، تحتوي على تسجيلات متزامنة لحركات اليد وحركات الرأس، توضح كيف يعدل الناس وجهة نظرهم عندما يصبح الهدف صعب الرؤية. استخدم الباحثون هذه البيانات لتدريب نموذج الكمبيوتر الخاص بهم على التعرف على الإشارات الدقيقة في حركة اليد التي تشير إلى هدف محدد، وفهم كيف تؤثر الرؤية المتغيرة للمشهد على حركة الرأس.
جوهر نظام HAP هو منهجية للتفكير فيما هو مخفي. فعندما يمد شخص ما يده نحو جسم ما، ينظر النظام إلى شكل الجسم ومسار اليد لتخصيص احتمالية لكل هدف محتمل. ثم يبني خريطة ديناميكية للمشهد، يتتبع من خلالها أي الأشياء تحجب رؤية غيرها. هذه الخريطة ليست ثابتة؛ فهي تتحدث مع حركة الشخص، حيث تحسب ليس فقط ما هو مخفي حالياً، بل ما يمكن أن يصبح مخفياً إذا غير الشخص موقعه قليلاً. يستخدم النظام شبكة تعالج هذه العلاقات بترتيب معين، يشبه تدفق المعلومات، لفهم كيف تتغير رؤية الهدف بمرور الوقت. وهذا يسمح للنموذج بالتنبؤ بأنه إذا كان الهدف محجوباً جزئياً، فمن المرجح أن يلتفت الشخص برأسه ليكشف عنه، بدلاً من مجرد الاستمرار في النظر في نفس الاتجاه.
تظهر نتائج الدراسة أن هذا النهج يعمل بشكل أفضل بكثير من الطرق السابقة. فعند اختباره على مجموعتهم الجديدة من البيانات وعلى مجموعة فيديوهات عامة موجودة، ارتكب نظام HAP أخطاء أقل في التنبؤ بالموضع والاتجاه المستقبلي للرأس مقارنة بالنماذج المتقدمة الأخرى. ووجد الباحثون أن مجرد التخمين بشأن الهدف لم يكن كافياً؛ بل كان النظام بحاجة إلى فهم تغير رؤية ذلك الهدف لإجراء تنبؤات دقيقة. كما اكتشفوا أن دمج التنبؤ المعقد مع افتراض بسيط بأن الرأس يستمر في الحركة بسرعة ثابتة ساعد في تنعيم النتائج، خاصة بالنسبة للمستقبل القريب. هذا المزيج من فهم الهدف، وتتبع العوائق، واحترام التدفق الطبيعي للحركة سمح للنظام بالتنبؤ بحركات الرأس بدقة عالية.
استكشفت الدراسة أيضاً ما يحدث إذا أُجبر النظام على تقديم تخمين واحد وحازم بشأن الهدف بدلاً من الاحتفاظ بنطاق من الاحتمالات. وأظهرت النتائج أن الاحتفاظ بدرجة من عدم اليقين بشأن الشيء الذي يمد الشخص يده نحوه أدى في الواقع إلى تحسين التنبؤ النهائي. وهذا يشير إلى أنه في المراحل الأولى من عملية الوصول، قبل ملامسة اليد للشيء، يضع الدماغ على الأرجلة عدة خيارات، وتكون حركة الرأس انعكاساً لهذه المرونة. ومن خلال الحفاظ على حالة عدم اليقين هذه في النموذج، استطاع النظام التكيف بشكل أفضل مع النتيجة النهائية. وخلص الباحثون إلى أن التنبؤات الأكثر نجاحاً جاءت من معاملة الرأس كمستشعر نشط يتكيف باستمرار مع المشهد المتغير، وليس مجرد تابع سلبي لليد.
بينما قدم النظام أداءً جيداً في البيئة المنضبطة لتجارب الطاولة، يقر الباحثون بأنه يواجه تحديات في البيئات الأكثر تعقيداً في العالم الحقيقي. تتطلب الطريقة الحالية قدرة حوسبية كبيرة لتتبع العلاقات بين العديد من الأشياء، وتعتمد على بيانات فيديو عالية الجودة قد لا تتوفر دائماً. ومع ذلك، فإن النتائج توفر مساراً واضحاً للأمام لإنشاء روبوتات ومساعدين افتراضيين يمكنهم التفاعل مع البشر بشكل أكثر طبيعية. فمن خلال فهم أن حركة الرأس مدفوعة بالحاجة إلى رؤية الهدف بوضوح، يمكن لهذه الأنظمة توقع الاحتياجات البشرية وتنسيق حركاتها الخاصة لدعم التفاعل الناجح. يوضح هذا العمل أنه لكي تفهم الآلات السلوك البشري حقاً، يجب أن تتعلم رؤية العالم ليس فقط كمجموعة من الأجزاء المتحركة، بل كلغز ديناميكي حيث يغير المراقب موقعه باستمرار للعثور على القطع المفقودة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.