Continual Field-Adaptive Models (CFAMs) for Post-Deployment Physical AI
تقدم هذه الورقة نماذج الحقول التكيفية المستمرة (CFAMs)، وهي بنية تعلم تكميلية تتميز بمكون بطيء التعلم مجمد وحقل كبسولة سريع التعلم يُمكّن الروبوتات الفيزيائية المتنوعة من اكتساب مهارات جديدة بكفاءة والتكيف مع سيناريوهات جديدة ومحققة خارج نطاق التوزيع (near-OOD) في الميدان من خلال تحديثات ذاتية خالية من التدرج مع الاحتفاظ بالكفاءة السابقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل روبوتاً أُرسل إلى مكان خطير وغير مستكشف: منجم منهار، أو مفاعل مشبع بالإشعاع، أو قاع أعماق المحيط. مهمته هي إزالة الحطام، أو فحص هيكل ما، أو استعادة جسم ما. في العالم الحقيقي، تكون هذه البيئات غير متوقعة. قد تكون الأرض عبارة عن حصى سائب بدلاً من خرسانة صلبة، أو قد تتحرك حمولة ثقيلة بشكل غير متوقع، أو قد يكون الباب أضيق مما تشير إليه الخرائط. لكي ينجح آلة ما، لا يمكنه ببساطة اتباع سيناريو كُتب في مختبر آمن؛ بل يجب أن يكون قادراً على التعلم من محيطه المباشر، والتكيف مع الظروف الجديدة فور ظهورها، دون الحاجة إلى إرسال تعليمات جديدة له من قبل إنسان أو حاسوب خارق لإعادة تدريب دماغه. هذا هو "الكأس المقدسة" للذكاء الاصطناዊ الفيزيائي: آلة يمكنها الخطو نحو الخطر، وفهم الأمور أثناء العمل، والاحتفاظ بما تعلمته دون أن تنسى كيف تقوم بالمهام التي كانت تعرفها بالفعل.
لسنوات، كان النهج القياسي لبناء هذه الآلات هو تغذيتها بكميات هائلة من البيانات في بيئة خاضعة للسيطرة، وتعليمها آلاف المتغيرات للمهمة الواحدة قبل أن تغادر المختبر أبداً. ولكن في المجالات الحرجة مثل الدفاع أو الاستجابة للكوارث، لا توجد مثل هذه البيانات. فالبيئات شديدة الخطورة بحيث لا يمكن تجهيزها بأجهزة استشعار، والمواقف فريدة جداً بحيث لا يمكن التنبؤ بها. إذا واجه الروبوت موقفاً لم يره من قبل، فإن النموذج التقليدي غالباً ما يفشل، أو الأسوأ من ذلك، أنه يحاول "التعلم" عبر الكتابة فوق معرفته القديمة، مما يتسبب في نسيانه لكيفية أداء واجباته الأساسية. وهذا يخلق معضلة: كيف تبني آلة ذكية بما يكفي للتعامل مع المجهول، وفي الوقت نفسه مستقرة بما يكفي لكي لا تفقد عقلها عندما تواجهه؟
اقترح فريق من الباحثين حلاً يسمى "نماذج المجال المستمر التكيفية" (CFAMs). ويشير عملهم، الذي اختُبر عبر خمسة أنواع مختلفة من الروبوتات تتراوح بين الكلاب الآلية والطائرات المسيرة والأذرع الشبيهة بالبشر والمركبات المخصصة للطرق الوعرة، إلى طريقة جديدة لبناء آلات يمكنها أن تصبح أكثر ذكاءً بعد نشرها ميدانياً. فبدلاً من محاولة إعادة تدريب دماغ الروبوت بالكامل في كل مرة يرى فيها شيئاً جديداً، يقوم النظام بفصل المعرفة "البطيئة" للروبوت عن تعلمه "السريع". الجزء البطيء، الذي يتولى المهام الشاقة المتعلقة بالإدراك واتخاذ القرار، يتم تجميده تماماً بعد التدريب الأولي في المختبر، ليعمل كقاعدة ثابتة. أما الجزء السريع، فهو عبارة عن بنك ذاكرة متخصص حيث يخزن الروبوت الدروس الجديدة والمحددة التي يواجهها أثناء العمل الميداني.
الفكرة الجوهرية هي أن الروبوت ليس بحاجة لإعادة تعلم كيفية المشي أو كيفية الإمساك بجسم ما في كل مرة تتغير فيها الأرض أو يتحرك الجسم. بدلاً من ذلك، يقوم بتخزين "كبسولة كفاءة"، وهي سجل مقتضب لنجاح محدد. فكر في الأمر كأنه نوتة موسيقية واحدة دقيقة تُضاف إلى مكتبة واسعة من المعرفة. عندما يواجه الروبوت موقفاً مختلفاً قليلاً عما يعرفه — كحمولة أثقل أو سطح زلق مثلاً — فإنه يراجع ذاكرته. إذا وجد درساً مخزناً قريباً بما يكفي، فإنه يستخدم ذلك الدرس لتعديل أفعاله. وإذا نجح، فإنه يكتب درساً جديداً ومختلفاً قليلاً في بنك الذاكرة الخاص به، مما يؤدي فعلياً إلى توسيع نطاق المواقف التي يمكنه التعامل معها. وتتم هذه العملية بالكامل على كمبيوتر الروبوت الخاص، دون أي إشراف بشري ودون أي إعادة تدريب رياضية معقدة لدماغه الرئيسي.
اختبر الباحثون هذا النظام من خلال تعليم الروبوتات بضع مهام في المختبر باستخدام عدد قليل فقط من العروض التوضيحية. ثم أرسلوا الروبوتات إلى بيئات محاكية وحقيقية حيث كانت الظروف مختلفة قليست عن بيانات التدريب. كانت النتائج مذهلة. فبينما فشلت الروبوتات القياسية التي حاولت التكيف عبر إعادة تدريب أدمغتها الرئيسية، أو نسيت مهاراتها الأصلية، استمرت روبوتات (CFAM) في التحسن. وفي إحدى مجموعات الاختبارات، حسنت الروبوتات معدل نجاحها بنحو أربع عشرة نقطة مئوية بمجرد التقاط وتخزين هذه النجاحات الصغيرة والمحققة أثناء عملها. لقد تعلمت التعامل مع الأحمال الأثقل، والتنقل في النباتات الكثيفة، والتعافي من الانزلاقات، كل ذلك مع الاحتفاظ بقدرتها على أداء المهام الأصلية بشكل مثالي.
والأهم من ذلك، أن النظام مصمم ليكون آمناً ومحدود النطاق؛ فهو يتعلم فقط من المواقف القريبة جداً مما يعرفه بالفعل، مما يضمن عدم محاولته ابتكار سلوكيات جديدة تماماً قد تكون خطيرة. كما أنه يحتوي على آلية مدمجة لتنظيف ذاكرته، حيث يدمج الدروس المتشابهة معاً حتى لا يمتلئ بنك الذاكرة. ووجد الباحثون أن هذا النهج سمح للروبوتات بالتعلم بكفاءة، باستخدام 40% فقط من البيانات التي يتطلبها عادةً تدريب روبوت قياسي، والاستمرار في النمو بذكاء بشكل مستقل في الميدان.
تؤكد الدراسة أنه من الممكن بناء ذكاء اصطناዊ فيزيائي لا يتوقف عن التعلم عند انتهاء التدريب. فمن خلال فصل المعرفة العامة المستقرة للروبوت عن الذاكرة المرنة والسريعة للتجارب الجديدة، نجح الباحثون في إنشاء نظام يمكنه التكيف مع الواقع الفوضوي وغير المتوقع للعالم المادي. إنها ليست آلة تتعلم كل شيء من الصفر كل يوم؛ بل هي آلة تبني على ما تعرفه، وتضيف تحسينات صغيرة ومحققة إلى مجموعة مهاراتها أثناء تقدمها. وبالنسبة للمهمات التي لا يستطيع البشر الذهاب إليها، فإن هذا النمو المستقل والمحدد النطاق يوفر مساراً للمضي قدماً: آلة يمكنها الخطو نحو المجهول، والتعلم من أخطائها ونجاحاتها، والاستمرار في المضي قدماً دون أن تنسى هويتها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.