Spiking Patches: Asynchronous, Sparse, and Efficient Tokens for Event Cameras
تقدم الورقة البحثية "الرقع النبضية" (Spiking Patches)، وهي طريقة لترميز الرموز (tokenization) غير متزامنة ومتفرقة للكاميرات الحدثية، تحافظ على خصائصها الفريدة مع تحقيق استنتاج أسرع ودقة مماثلة أو متفوقة على الأساليب القائمة على الإطارات والمكعبات (voxels) عبر مختلف المهام الرؤية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما اعتمدت الروبوتات والسيارات ذاتية القيادة على الكاميرات القياسية التي تلتقط العالم مثل كاميرا السينما، حيث تأخذ صورة كاملة للمشهد في كل جزء من الثانية. تعمل هذه الطريقة بشكل جيد في كثير من الأمور، لكنها تخلق عبئاً ثقيلاً من البيانات، حيث يكون الكثير منها مجرد مساحات فارغة أو خلفيات لم تتغير. وهناك نوع أحدث من المستشعرات، يُعرف باسم "كاميرا الأحداث" (event camera)، يعمل وفق مبدأ مختلف. فبدلاً من التقاط صور كاملة، تقوم فقط بتسجيل التغييرات. فعندما تلاحظ بكسلات المستشعر تغيراً في السطوع، ترسل إشارة واحدة، أو "حدثاً"، في تلك اللحظة تحديداً. وهذا يعني أن الكاميرا تنتج تدفقاً من الإشارات المنعزلة التي تعمل بشكل غير متزامن (asynchronous)، أي تحدث كلما حدث تغيير، بدلاً من العمل وفق إيقاع ثابت. ويعني هذا أيضاً أن البيانات تكون متفرقة (sparse)، حيث تحتوي فقط على المعلومات المتعلقة بمكان الحركة أو التغيير، تاركة بقية المشهد صامتاً. وبينما يعد هذا النهج فعالاً وسريعاً للغاية، فقد كان من الصعب تغذية هذا التدفق الفريد من البيانات في نماذج الذكاء الاصطناعي التي تستخدمها الروبوتات لفهم محيطها.
لسنوات، حاول الباحثون حل هذه المشكلة عبر إجبار هذه الإشارات غير المتزامنة على اتخاذ التنسيق المألوف والقديم للصور القياسية. حيث كانوا يجمعون الأحداث في نوافذ زمنية ثابتة لإنشاء إطار، تماماً مثل تجميع سلسلة من اللقطات. ومع ذلك، فإن هذه العملية تدمر الخصائص التي تجعل كاميرات الأحداث مميزة. فمن خلال الانتظار لفترة زمنية ثابتة قبل إنشاء صورة، يفقد النظام القدرة على الاستجابة الفورية للتغيرات المفاجئة، ومن خلال ملء المساحات الفارغة، يفقد كفاءة امتلاك البيانات ذات الصلة فقط. وقد اقترح فريق من الباحثين في الجامعة التقنية في الدنمارك الآن طريقاً جديداً للمضي قدماً؛ حيث طوروا طريقة جديدة تسمى "الرقع النابضة" (Spiking Patches)، والتي تعامل مجموعات هذه الإشارات المتغيرة كوحدات منفردة من المعلومات دون إجبارها على شبكة صارمة قائمة على الوقت. يسمح هذا النهج للبيانات بأن تظل غير متزامنة ومتفرقة، مما يحافظ على سرعة وكفاءة المستشعر الأصلي مع جعلها متوافقة مع نماذج الذكاء الاصطناعي القوية والحديثة.
صمم الباحثون نظامهم من خلال النظر في كيفية عمل الخلايا العصبية البيولوجية. ففي الدماغ، تنتظر الخلية العصبية حتى تتلقى عدداً كافياً من الإشارات لتصل إلى حد معين قبل أن تطلق نبضة. طبق الفريق هذا المنطق نفسه على بيانات كاميرا الأحداث. فقد قسموا رؤية الكاميرا إلى شبكة من المربعات الصغيرة، أو "الرقع" (patches). ومع وصول الأحداث، تتراكم داخل كل رقعة، مما يرفع جهداً افتراضياً. وبمجرد أن يصل عدد الأحداث في الرقعة إلى حد معين، "تطلق" الرقعة نبضة، وتنشئ "رمزاً" (token) يمثل تلك المجموعة من الأحداث. يتم بعد ذلك إرسال هذا الرمز إلى نموذج الذكاء الاصطناعي للمعالجة. ومن الأهمية بمكان أن هذا الإطلاق يحدث بشكل مستقل لكل رقعة وفي اللحظة التي يتم فيها الوصول إلى الحد المطلوب، وليس انتظاراً لدقات الساعة. وهذا يعني أن النظام يمكنه الاستجابة لجسم سريع الحركة في اللحظة التي تتراكم فيها الأحداث الكافية، دون انتظار بناء إطار كامل.
ولاختبار ما إذا كانت هذه الفكرة ناجحة في الممارسة العملية، قارن الفريق بين "الرقع النابضة" وبين أكثر طريقتين شائعتين للتعامل مع بيانات الأحداث: الإطارات القياسية وكتل البيانات ثلاثية الأبعاد المعروفة باسم "فوكسلز" (voxels). واختبروا الطريقة على ثلاثة أنواع مختلفة من بنيات الذكاء الاصطناعي، بما في ذلك الشبكات المصممة للرسوم البيانية (graphs)، والسحب النقطية (point clouds)، والمحولات (transformers)، باستخدام مهام مثل التعرف على إيماءات اليد واكتشاف السيارات في لقطات القيادة. وكانت النتائج مذهلة؛ فمن حيث السرعة، كانت الطريقة الجديدة أسرع بكثير من البدائل. فعند التعرف على الإيماءات، كانت طريقة "الرقع النابضة" أسرع بمقدار يصل إلى 3.4 مرة من طريقة "الفوكسلز" وأسرع بمقدار يصل إلى 10.4 مرة من الطريقة القائمة على الإطارات. وجاءت هذه السرعة دون التضحية بالدقة؛ ففي كثير من الحالات، كانت الطريقة الجديدة بنفس دقة الطرق القديمة، وفي بعض الحالات، كانت أكثر دقة، حيث حسنت التعرف على الإيماءات بنسبة تصل إلى 3.8 نقطة مئوية واكتشاف الأشياء بنسبة تصل إلى 1.4 نقطة مئوية.
كما أكدت الدراسة أن الطريقة نجحت في الحفاظ على تفرق البيانات وعدم تزامنها. فقد قاس الباحثون مدى سرعة قدرة النظام على جمع معلومات كافية للاستجابة لمشهد ما مقارنة بالتدفق الخام للأحداث. ووجدوا أن نظام "الرقع النابضة" يمكنه الاستجابة بسرعة تقارب سرعة الأحداث الخام نفسها، مع تأخير ضئيل جداً لا يتعدى بضعة ميلي ثانية، بينما كانت الطرق القائمة على الإطارات مجبرة على الانتظار لفترة زمنية ثابتة، مما يؤدي إلى تأخير أطول بكثير. علاوة على ذلك، قللت الطريقة الجديدة من كمية البيانات التي يتعين على الكمبيوتر معالجتها بمعامل لا يقل عن 1.5 مقارنة بالإطارات والفوكسلز، وفي بعض الحالات، بمئات المرات مقارنة بتدفق الأحداث الخام. وهذا التقليل في حجم البيانات هو ما يسمح للنظام بالعمل بهذه السرعة الكبيرة، حيث يكون لدى الكمبيوتر عناصر أقل لتحليلها.
ومن أكثر الجوانب العملية لهذا الاكتشاف هو أن النظام سريع بما يكفي للتعامل مع التطبيقات في الوقت الفعلي. فقد نفذ الباحثون عملية "الترميز" (tokenization) في لغة برمجة معروفة بسرعتها، ووجدوا أن النظام يمكنه توليد الرموز بسرعة أكبر من وصول الأحداث الجديدة إلى الكاميرا. وهذا يعني أن النظام يمكنه مواكبة تدفق المعلومات في سيناريوهات العالم الحقيقي، مثل قيادة سيارة على طريق سريع، دون التخلف عن الركب. كما استكشف الفريق كيف تؤثر الإعدادات المختلفة على الأداء، ووجدوا أنه يمكنهم ضبط حساسية النظام للمفاضلة بين عدد الرموز المولدة ودقة النتيجة. فعلى سبيل المثال، من خلال إدخال توقف قصير بعد إطلاق الرقعة، يمكنهم تقليل عدد الرموز بمقدار أربعة أضعاف مع الحفاظ على دقة مماثلة تقريباً.
وعلى الرغم من أن النتائج واعدة، إلا أن الباحثين يشيرون إلى أن الطريقة تتطلب ضبطاً دقيقاً للحد الذي يحفز إطلاق الرمز. فإذا تم ضبط الحد الأدنى منخفضاً جداً، فقد يطلق النظام نبضات بشكل متكرر، مما يخلق الكثير من البيانات. وإذا تم ضبطه عالياً جداً، فقد يفوت تفاصيل مهمة. ويقترح الفريق أن العمل المستقبلي يمكن أن يركز على جعل هذا الحد يتكيف تلقائياً مع المشهد. كما يخططون لاختبار الطريقة في أنواع أخرى من المهام، مثل تتبع الأجسام المتحركة أو حساب تدفق الحركة في مشهد ما. ومع ذلك، فإن هذا العمل يثبت إمكانية سد الفجوة بين الطبيعة الفريدة وغير المتزامنة لكاميرات الأحداث ونماذج الذكاء الاصطناعي القوية التي تقود الروبوتات الحديثة. فمن خلال التعامل مع مجموعات الأحداث كوحدات واحدة ذات معنى، أظهر الباحثون أنه يمكننا الحفاظ على سرعة وكفاءة كاميرات الأحداث دون فقدان القدرة على استخدام أكثر أدوات الذكاء الاصطناعي تقدماً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.