Wandering around: A bioinspired approach to visual attention through object motion sensitivity
تقدم هذه الورقة نظام انتباه مستوحى حيويًا وخاليًا من التعلم، يستخدم كاميرات تعتمد على الأحداث وشبكات عصبية تلافيفية نبضية لتحقيق تقسيم حركة الأجسام واستهداف حركات العين السريعة في الوقت الفعلي وبكفاءة للتطبيقات الروبوتية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تسير في ملهى ليلي مزدحم ومظلم. عيناك ليستا مجرد كاميرات ثابتة؛ بل هما تتحركان باستمرار، وتنتقلان من لعبة دوارة ساطعة إلى شخص يتحرك، ثم تستقران لجزء من الثانية على كشك للوجبات الخفيفة. أنت لا تحاول معالجة كل بكسل من الملهى بأكمله في وقت واحد — لأن ذلك سيؤدي إلى تعطل دماغك. بدلاً من ذلك، يستخدم دماغك "الانتباه الانتقائي" (Selective Attention) لتجاهل الضجيج في الخلفية والتركيز على ما يتحرك أو ما هو مثير للاهتمام بالفعل.
تصف هذه الورقة البحثية طريقة لمنح الروبوتات هذه "القوة الخارقة" الشبيهة بالبشر باستخدام نوع متخصص من الأدمغة الاصطناعية.
المشكلة: "طوفان البيانات"
ترى معظم الروبوتات العالم مثل شخص يلتقط آلاف الصور عالية الدقة كل ثانية. هذا يخلق "طوفاناً من البيانات". يتعين على الروبوت معالجة كل تفصيل — الأرضية الثابتة، الجدران، السقف — حتى لو لم يكن هناك شيء يحدث هناك. هذا يجعل الروبوتات بطيئة، ومستهلكة للطاقة، وعرضة لـ "التجمد" عندما تصبح الأمور معقدة للغاية.
الحل: "الرعشة الذكية"
قام الباحثون ببناء نظام يحاكي كيفية عمل العيون والأدمغة البيولوجية معاً. لقد استخدموا ثلاثة "مكونات" رئيسية:
1. كاميرا الأحداث (المستشعر "المعتمد على الحركة فقط")
بدلاً من الكاميرا العادية التي تلتقط صوراً كاملة، استخدموا كاميرا تعتمد على الأحداث (Event-Based Camera). فكر في هذا كأنه مستشعر "أعمى" عن كل ما يظل ثابتاً. إذا كان الجدار لا يتحرك، فإن الكاميرا لا ترى شيئاً. هي "تستيقظ" فقط وترسل إشارة عندما يحدث تغيير (مثل مرور شخص بجانبها). إنها تشبه نظام أمني يسجل فقط عند اكتشاف حركة، بدلاً من التصوير على مدار الساعة طوال اليوم.
2. نموذج sOMS (الـ "فلتر")
حتى مع وجود كاميرا أحداث، فإن حركة الروبوت نفسه تخلق الكثير من الحركة "الزائفة" (لأن الكاميرا نفسها تتحرك). قام البالبثون بإنشاء وحدة تسمى sOMS.
- التشبيه: تخيل أنك في حافلة متعرجة. كل شيء خارج النافذة يبدو وكأنه يتحرك، لكن يمكنك التمييز بين الأشجار التي تتحرك وبين حركة الحافلة نفسها. يعمل الـ sOMS كفلتر ذهني يقول: "تجاهل حركة الحافلة المتعرجة؛ وركز فقط على الأشياء التي تتحرك بشكل مستقل". إنه يقوم فعلياً بـ "كتم" ضجيج الخلفية بحيث تبقى فقط الأجسام المتحركة المهمة.
3. النموذج الأولي للكائن (الـ "مكتشف الأشكال")
بمجرد أن يعرف النظام أن شيئاً ما يتحرك، فإنه يحتاج لمعرفة ماهيته. يستخدم نموذج SNN Proto-object قوانين "الجشطالت" (Gestalt laws) — وهي نفس القواعد التي يستخدمها دماغك لإدراك أن سلسلة من النقاط تشكل في الواقع دائرة. يقوم النموذج بتجميع الحواف المتحركة معاً ليقول: "مهلاً، هذا ليس مجرد ضجيج عشوائي، بل هو جسم واحد!".
4. الرأرأة (الـ "تكبير والتركيز")
أخيراً، بمجرد أن يحدد الروبوت جسماً "بارزاً" (مثيراً للاهتمام)، فإنه لا يكتفي بمراقبته من بعيد. بل يقوم بعملية رأرأة (Saccade) — وهي حركة سريعة ومتعثرة لتوجيه "عينه" (الكاميرا) مباشرة نحو الجسم. بعد ذلك، يقوم بحركات "تثبيت" دقيقة مجهرية للحفاظ على التركيز عالي الدقة على الجسم.
لماذا يهم هذا؟
اختبر الباحثون هذا النظام على إعداد روبوت حقيقي (كاميرا على قاعدة محركة) ووجدوا أنه سريع وفعال للغاية.
- إنه سريع: يمكنه اكتشاف جسم متحرك في حوالي 0.12 ثانية — أسرع من رمشة العين!
- إنه فعال: لأنه يتجاهل الأجزاء "المملة" من المشهد، فإنه يستهلك طاقة حوسبة أقل بكثير.
- إنه قوي: يعمل في الإضاءة المنخفضة وفي البيئات الفوضوية حيث قد ترتبك الروبوتات التقليدية.
الصورة الكبيرة
باختصار، تنقلنا هذه الورقة البحثية بعيداً عن الروبوتات التي "تحدق بفراغ" في كل شيء، ونحو الروبوتات التي "تنظر" بالطريقة التي ننظر بها نحن: تمسح الأفق، تتجاهل الفوضى، وتوجه انتباهها بسرعة نحو الأشياء التي تهم حقاً. هذه خطوة كبيرة نحو جعل الروبوتات قادرة على التنقل في بيئاتنا الواقعية والمتحركة وغير المتوقعة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.