Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation
تُعد Zeva إطار عمل مبتكر يُمكّن من التلاعب المجسد القابل للتعميم عبر استخراج التفاعلات السببية من التجارب الفيزيائية للروبوت إلى ذاكرة ثنائية المقياس الزمني، مما يسمح لنموذج سياسة مجمد بالتطور الذاتي وتحسين أدائه عبر المهام من خلال التعلم داخل السياق دون الحاجة إلى تحديثات التدرج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما كانت الروبوتات أساتذة في أرض المصنع، حيث تكرر الحركة نفسها آلاف المرات بدقة مثالية. لكن بمجرد إخراجها من تلك البيئة المنضبطة ووضعها في مطبخ حقيقي أو مختبر، فإنها غالباً ما تتعثر. فالعالم المادي فوضوي؛ الأشياء تتحرك، والأسطح غير مستوية، والطريقة التي يشعر بها القابض بكأس من الماء تختلف عن شعوره بكوب معدني. لسنوات، كان النهج الرائد لتعليم الروبوتات هو تغذيتها بكميات هائلة من الفيديو والبيانات قبل أن تغادر المختبر، على أمل أن تتعلم قواعد عامة كافية للتعامل مع أي شيء. ومع ذلك، عندما تواجه هذه الروبوتات موقفاً لم تره من قبل، فإنها تفشل تكراراً لأن "دماغها" الداخلي لا يستطيع التكيف مع فيزياء اللحظة الجديدة. إنها تظل عالقة بالمعرفة التي أُعطيت لها، غير قادرة على التعلم من أخطائها أثناء وقوعها.
اقترح فريق من الباحثين في جامعة تسينغ هوا وشركة Z-Trans AI مساراً مختلفاً، مساراً يتعلم فيه الروبوت التفكير في السبب والنتيجة في الوقت الفعلي. لقد قدموا نظاماً يسمى "Zeva"، والذي يسمح للروبوت بتحسين أدائه دون تغيير رمز برمجته الأساسي أبداً. وبدلاً من محاولة إعادة تدريب دماغ الروبوت، وهو أمر بطيء ومخاطرة، يعمل Zeva مثل دفتر ملاحظات منظم للغاية. فبينما يحاول الروبوت تنفيذ مهمة ما، فإنه يسجل بالضبط ما حدث عندما تحرك: رأى جسماً معيناً، وحرك ذراعه بطريقة معينة، فبقي الجسم في مكانه أو انقلب. يستخلص النظام الدرس من هذا التفاعل الواحد — الرابط السببي بين الفعل والنتيجة — ويقوم بتخزينه. وعندما يحاول الروبوت المهمة نفسها مرة أخرى، فإنه ينظر إلى هذا الدفتر، ويجد الدرس ذي الصلة، ويستخدمه لتعديل حركته التالية. يحدث هذا فوراً، مما يسمح للروبوت بأن يصبح أفضل مع كل محاولة، حتى لو ظل برنامجه الأساسي مجمداً وغير متغير.
اختبر الباحثون هذه الفكرة في عالمين مختلفين تماماً. أولاً، استخدموا محاكاة حاسوبية متطورة لمطبخ، وهو مكان مليء بالأشياء المعقدة مثل الغلايات والمحامص والخلاطات. في هذه البيئة الافتراضية، واجه Zeva خمس مهام متميزة، مثل تشغيل الميكروويف أو فتح رأس الخلاط. كانت النتة مذهلة؛ فبينما تمكنت أنظمة الروبوت المتقدمة الأخرى من النجاح بنسبة تتراوح بين 60 إلى 72 بالمائة، وصل Zeva إلى معدل نجاح بلغ 76.8 بالمائة. والأهم من ذلك، أظهر النظام نمطاً واضحاً من التحسن الذاتي. ففي محاولته الأولى لمهمة ما، نجح الروبوت في حوالي ربع الحالات فقط. ولكن بينما كان يُسمح له بالاستمرار في المحاولة في نفس السيناريو، مستخدماً الدروس المستفادة من إخفاقاته لتوجيه حركاته التالية، ارتفع معدل نجاحه بشكل مطرد. وبحلول المحاولة الرابعة، كان ينجح في 73 بالمائ % من الحالات. أثبت هذا أن الروبوت لم يكن يحظى بالحظ فحسب، بل كان يتعلم حقاً من التغذية الراجعة الفيزيائية لأفعاله.
ولضمان أن هذا لم يكن مجرد نتيجة لمحاكاة الحاسوب، نقل الفريق النظام إلى مختبر كيميائي حقيقي. فقد زودوا ذراع روبوت مادية بالقدرة على التعامل مع الأواني الزجاجية الدقيقة، مثل أنابيب الاختبار والدوارق، وأداء مهام مثل سكب الماء أو وزن المواد الكيميائية. كانت هذه البيئة أكثر عدم استقرار من المحاكاة، مع وجود جاذبية حقيقية، واحتكاك، وخطر كسر الزجاج. وهنا، تفوق Zeva مرة أخرى على أفضل الأنظمة الموجودة. ففي المهام الأبسط، مثل التقاط أنبوب اختبار، نجح بنسبة 100 بالمائة. وفي التسلسلات الأكثر تعقيداً، مثل تحضير محلول ملحي، حقق معدل نجاح قدره 70 بالمائة، وهو أعلى بكثير من منافسيه. كما قاس الباحثون مقدار ما أكمله الروبوت من العملية، وليس فقط ما إذا كان قد أنهى المهمة بأكملها. فحتى عندما كانت المهمة صعبة، تمكن Zeva من إكمال عدد أكبر من الخطوات المطلوبة مقارنة بأي نظام آخر، مما أظهر أن قدرته على التعلم من التفاعل ساعدته في التنقل عبر الواقع الفوضوي للعالم المادي.
جزء رئيسي من نجاح Zeva هو كيفية تنظيم ذاكرته. فالنظام لا يقوم فقط بتخزين قائمة طويلة لكل ما فعله على الإطلاق؛ لأن ذلك سيكون كثيراً جداً للمعالجة بسرعة. بدلاً من ذلك، يستخدم نوعين من الذاكرة يعملان معاً. أحدهما هو أثر قصير المدى يتذكر الثواني القليلة الأخيرة من الفعل، مما يساعد الروبوت على فهم ما يحدث الآن. والآخر هو ذاكرة مستمرة تحتفظ بالدروس الأكثر فائدة من المحاولات السابقة، حتى لو فشلت تلك المحاولات. عندما يبدأ الروبوت محاولة جديدة، فإنه يبحث في هذه الذاكرة المستمرة عن موقف يشبه الموقف الذي يواجهه الآن. ثم يستخدم تلك التجربة الماضية كدليل. على سبيل المثال، إذا حاول الروبوت سابقاً سكب الماء وانقلب الكأس لأنه مال بسرعة كبيرة، فإنه يتذكر تلك العلاقة المحددة بين السبب والنتيجة. وفي المحاولة التالية، يستشير هذه الذاكرة ويبطئ ميلانه، متجنباً الخطأ نفسه. تحدث هذه العملية دون أي تغييرات في برنامج الروبوت الرئيسي، مما يعني أن الروبوت يمكنه التعلم والتكيف فوراً دون عملية إعادة تدريب بطيئة وخطيرة لدماغه بالكامل.
اكتشف الباحثون أيضاً أن هذا النظام يمكنه التعلم من البشر، وليس فقط من أخطائه الخاصة. ففي إحدى التجارب، قام إنسان بتوجيه ذراع الروبوت فيزيائياً خلال محاولة ناجحة واحدة لمهمة معقدة. سجل النظام هذا العرض البشري، واستخلص الدروس السببية، وخزنها في ذاكرته. وعندما حاول الروبوت المهمة بمفرده، استخدم هذا المثال البشري الوحيد لبدء تعلمه. سمحت هذه "المرحلة التمهيدية" للروبوت بالأداء بشكل أفضل بكثير منذ البداية، حيث رفع معدل نجاحه بنسبة تصل إلى 15 بالمائة مقارنة بما لو كان عليه التعلم تماماً من الصفر. وهذا يشير إلى أن الروبوت يمكنه تعلم مهارة جديدة من عرض بشري واحد، ثم صقل تلك المهارة من خلال ممارسته المتكررة، جامعاً بين أفضل التوجيهات البشرية وقوة التطور الذاتي.
بحثت الدراسة أيضاً فيما إذا كانت الدروس التي يتعلمها الروبوت في مهمة واحدة يمكن أن تساعده في مهمة مختلفة تماماً. ووجدوا أن النظام يمكنه التعرف على متى يكون التأثير الفيزي في مهمة جديدة مشابهاً لما رآه من قبل. على سبيل المثال، تم التعرف على حركة إمالة حاوية لسكب الماء كحركة مشابهة لإمالة حاوية لخلط المواد الكيميائية، على الرغم من اختلاف الأشياء والأهداف. إن القدرة على نقل المعرفة عبر المهام تعني أن الروبوت ليس بحاجة للبدء من الصفر في كل مرة يواجه فيها تحدياً جديداً. يمكنه الاستعانة بمكتبة من العلاقات السببية الفيزيائية التي بناها بمرور الوقت، مما يجعله أكثر تنوعاً وقدرة في مجموعة واسعة من المواقف.
على الرغم من هذه النجاحات، يوضح الباحثون حدود عملهم. فالنظام يتعلم حالياً فقط من المحاولات التي يقوم بها أثناء محاولة إنهاء مهمة محددة. وليس لديه بعد القدرة على التجول واستكشاف العالم لمجرد تعلم أشياء جديدة، وهو سلوك يُعرف باسم "الاستكشاف النشط". ويقترح المؤلفون أن العمل المستقبلي سيركز على تعليم الروبوت اختيار تجاربه الخاصة، وتجربة أفعال مختلفة عن قصد لتقليل عدم اليقين بشأن كيفية عمل العالم المادي. وحتى ذلك الحين، يمثل Zeva خطوة هامة للأمام، حيث يظهر أن الروبوت لا يحتاج إلى إعادة تدريبه ليصبح أكثر ذكاءً. فببساطة، من خلال الانتباه إلى عواقب أفعاله وتذكر ما نجح وما لم ينجح، يمكن للروبوت تطوير قدراته، محولاً كل إخفاق إلى درس للمحاولة التالية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.