Towards smart and adaptive agents for active sensing on edge devices
تقدم هذه الورقة نظاماً وكيلياً مدمجاً قائماً على الاستدلال النشط، يتيح الاستشعار النشط التكيفي في الوقت الفعلي على الأجهزة الطرفية ذات الموارد المحدودة، وذلك من خلال السماح لها بالتخطيط والتحكم الديناميكي في حركات الكاميرا للتغلب على قيود نهج تعلم الآلة الصغير (TinyML) التقليدي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل كاميرا لا تكتفي بمجرد تسجيل العالم، بل تختار بنشاط ما تنظر إليه، تماماً مثل العين البشرية التي تنتقل من تفصيل إلى آخر لبناء صورة كاملة. هذا هو مجال الاستشعار النشط، وهو مفهوم لا تنتظر فيه الآلات البيانات بشكل سلبي، بل تحرك مستشعراتها لجمع المعلومات الأكثر فائدة. لسنوات، كان الحلم هو وضع هذا النوع من السلوك الذكي والتكيفي على أجهزة صغيرة تعمل بالبطارية وتوجد في موقع حدوث الفعل مباشرة، مثل كاميرا مراقبة أو روبوت، دون الحاجة إلى إرسال البيانات إلى خادم سحابي بعيد. كان التحدي يكمس في أن أنظمة الذكاء الاصطناعي القوية القادرة على فعل ذلك تتطلب عادةً كميات هائلة من القدرة الحوسبية والذاكرة، مما يجعل تشغيلها على هذه الأجهزة الصغيرة والمحلية أمراً مستحيلاً.
لقد تمكن فريق من الباحثين الآن من بناء نظام يسد هذه الفجوة، حيث ابتكروا وكيلًا ذكيًا يمكنه الرؤية، والتخطيط، وتحريك الكاميرا في الوقت الفعلي أثناء تشغيله على جهاز لا يتجاوز حجمه لوحة كمبيوتر صغيرة. أظهر هذا العمل، الذي نُشر في دراسة حديثة، أنه من الممكن الجمع بين نهجين مختلفين للذكاء الاصطناعي: أحدهما بارع في التعرف على الأشياء في الصور، والآخر بارع في اتخاذ القرارات في ظل عدم اليقين. والنتيجة هي "وكيل الساكات" (saccade agent)، تيمناً بحركات العين السريعة والمتقطعة التي يقوم بها البشر للتركيز على التفاصيل، والذي يمكنه التحكم في الكاميرا لتتبع الأشخاص أو استكشاف غرفة بشكل مستقل. يعمل النظام بالكامل على الجهاز الطرفي (edge device)، مما يعني أنه يعالج كل شيء محلياً، مما يضمن ردود فعل سريعة ويحافظ على خصوصية البيانات.
واجه الباحثون مشكلة محددة: نماذج التعلم العميق القياسية، وهي جيدة جداً في رصد أشياء مثل الأشخاص أو السيارات في بث الفيديو، هي نماذج جامدة. فبمجرد تدريبها، تجد صعوبة في التكيف إذا تغيرت البيئة أو إذا احتاجت إلى تقرير أين تنظر تالياً للعثور على شيء جديد. فهي تعتمد على كميات ضخمة من البيانات والقدرة الحوسبية للتعلم، وهو عكس ما يحتاجه جهاز صغير ومنخفض الطاقة. ولحل هذه المشكلة، لم يحاول الفريق جعل نموذج التعلم العميق أكبر أو أكثر ذكاءً، بل أضافوا طبقة ثانية من الذكاء فوقه، تعتمد على مبدأ يسمى "الاستدلال النشط" (active inference). يتعامل هذا النهج مع الوكيل كعالم يقوم باستمرار بتحديث معتقداته حول العالم؛ فهو يسأل نفسه: "ما الذي أتوقع رؤيته؟" و"ما الذي قد يفاجئني؟". إذا رأت الكاميرا شيئاً جديداً، فإن الوكيل يقرر التحرك إلى مكان مختلف للتعلم أكثر. وإذا رأت شيئاً مثيراً للاهتمام، مثل شخص ما، فإنها تركز عليه. عملية اتخاذ القرار هذه خفيفة للغاية، وتتطلب ذاكرة قليلة جداً، مما يسمح لها بالعمل جنباً إلى جنب مع برمجيات اكتشاف الأشياء الأكثر ثقلاً.
لاختبار هذه الفكرة، بنى الفريق نموذجاً أولياً مادياً باستخدام جهاز NVIDIA Jetson، وهو كمبيوتر قوي مصمم لمهام الذكاء الاصطناعي على الأجهزة الطرفية. قاموا بتوصيل هذا الجهاز بكاميرا يمكنها التحريك والتدوير (pan and tilt)، على غرار كاميرات المراقبة الموجودة في العديد من المباني. أُعطي النظام مهمة بسيطة ولكنها قوية: مراقبة مشهد وتحديد أين توجه العدسة. الجزء الأول من النظام، وهو وحدة الإدراك، استخدم أداة معروفة لاكتشاف الأشياء تسمى YOLO لمسح بث الفيديو والعثيد على الأشخاص أو الأشياء. وقد تم تحسين هذه الأداة لتعمل بسرعة على أجهزة الجهاز. أما الجزء الثاني، وهو وحدة التخطيط، فقد أخذ قائمة الأشياء التي رأتها الكاميرا واستخدم الاستدلال النشط لتحديد الحركة التالية. لقد حسب الاتجاه الذي يجب أن تدير الكاميرا نفسها فيه، سواء لمواصلة مراقبة شخص ما أو لمسح منطقة فارغة لمعرفة ما إذا كان أي شيء جديد سيظهر.
أظهرت النتائج أن هذا الجمع عمل بشكل جيد للغاية ضمن الحدود الصارمة للأجهزة. استوعب النظام بأكره، بما في ذلك البرمجيات اللازمة لتشغيله، بصمة ذاكرة تبلغ 304 ميجابايت فقط، وهو حجم ضئيل جداً بالنسبة لنظام ذكاء اصطناعي. في أحد التكوينات، استطاعت الكاميرا معالجة الفيديو واتخاذ قرار بشأن مكان النظر تالياً 108 مرات في كل ثانية، وهي سرعة كافية لتبدو فورية للمراقب البشري. وفي إعداد آخر، أعطى النظام الأولوية للسرعة على حساب الذاكرة، محققاً تحليل 45 إطاراً من الفيديو في الثانية مع اتخاذ قرارات 250 مرة في الثانية. وجد الباحثون أن الوقت الذي استغرقه اتخاذ القرار كان قصيراً جداً لدرجة أن النظام استطاع بسهولة مواكبة بث الفيديو، مما سمح للكاميرا بتتبع الأهداف المتحركة بسلاسة أو مسح الغرفة دون تأخير.
ما يجعل هذا الإنجاز مهماً ليس فقط حركة الكاميرا، بل كيفية حركتها. لم يتبع الوكيل مساراً مبرمجاً مسبقاً، بل تفاعل مع البيئة في الوقت الفعلي. فإذا دخل شخص إلى الإطار، تقوم الكاميرا بالتركيز عليه. وإذا تحرك الشخص، تتبعه الكاميرا. وإذا غادر الشخص وأصبحت الغرفة فارغة، يقرر الوكيل مسح بقية الغرفة ليرى ما إذا كان هناك أي شيء آخر يحدث. هذا السلوك يحاكي الطريقة التي يستكشف بها البشر محيطهم بشكل طبيعي، حيث يوازنون بين الحاجة إلى التركيز على ما هو مهم والحاجة إلى البقاء على دراية بالصورة الكاملة. وقد أظهر الباحثون ذلك من خلال كاميرا مثبتة على روبوت صغير، موضحين أن النظام يمكنه مساعدة الآلة على استكشاف بيئة جديدة وجمع المعلومات بكفاءة دون تدخل بشري.
كما اختبرت الدراسة بعناية طرقاً مختلفة لتشغيل البرامج على الأجهزة لإيجادة أفضل توازن بين السرعة واستخدام الذاكرة. ووجدوا أن استخدام أدوات محددة مصممة لمعالج الرسوميات الخاص بالجهاز سمح للنظام بالعمل بشكل أسرع بكثير من استخدام الطرق القياسية. ومع ذلك، اكتشفوا أيضاً أنه بالنسبة لجزء اتخاذ القرار في النظام، وهو جزء صغير جداً، فإن محاولة تشغيله على معالج الرسوميات القوي أدت في الواقع إلى إبطائه لأن العبء الإداري للمهمة كان أكبر من الفائدة المرجوة من القوة الإضافية. يسلط هذا الاكتشاف الضوء على أهمية مطابقة أدوات البرمجيات الصحيحة مع الأجهزة الصحيحة، وهي خطوة حاسمة لجعل هذه الأنظمة عملية للاستخدام في العالم الحقيقي.
يشير هذا العمل إلى أن مستقبل الأجهزة الذكية لا يتطلب بالضرورة حواسيب فائقة ضخمة تعتمد على السحابة. فمن خلال الجمع بين القدرة القوية على الرؤية والقدرة الخفيفة على التخطيط، من الممكن إنشاء وكلاء يتميزون بالذكاء والكفاءة في آن واحد. لقد أظهر الباحثون أن هذه الأنظمة يمكن أن تعمل بشكل مستقل، متخذة قرارات في أجزاء من الثانية لجمع المعلومات في بيئات معقدة ومتغيرة. وبينما يركز النظام الحالي على التحكم في الكاميرا، يمكن تطبيق نفس المبادئ على مهام أخرى، مثل مساعدة روبوت على التنقل في غرفة مزدحمة أو مساعدة طائرة بدون طيار في البحث عن شخص مفقود. وتخلص الدراسة إلى أن الاستدلال النشط يقدم مساراً واعداً نحو إنشاء آلات تكيفية وفعالة في استهلاك الموارد، يمكنها التعامل مع عدم القدرة على التنبؤ في العالم الحقيقي، مما يجلب قوة الاستشعار الذكي مباشرة إلى الأجهزة الطرفية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.