MoRI: Mixture of RL and IL Experts for Long-Horizon Manipulation Tasks
تُعد MoRI إطار عمل جديد للمناولة الروبوتية يجمع ديناميكيًا بين خبراء التعلم بالتقليد والتعلم التعزيزي لتحقيق معدلات نجاح عالية، وتقارب سريع، وتقليل كبير في التدخل البشري في المهام المعقدة طويلة المدى.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتاً كيفية أداء مهمة معقدة، مثل طي منشفة أو وضع مكعب في درج. لديك طريقتان رئيسيتان لتعليمه:
"المُقلد" (التعلم بالتقليد - Imitation Learning): تعرض على الروبوت فيديو لإنسان يقوم بالمهمة بشكل مثالي، ويحاول الروبوت تقليده.
- الإيجابيات: يتعلم بسرعة.
- السلبيات: إذا ارتكب الروبوت خطأً بسيطاً في البداية، فإنه يصاب بالارتباك ويستمر في ارتكاب أخطاء أكبر. الأمر يشبه طالباً يحفظ الإجابات لكنه لا يفهم الرياضيات؛ إذا تغير سؤال الاختبار قليلاً، سيفشل.
"المستكشف" (التعلم التعزيزي - Reinforcement Learning): تترك الروبوت يجرب، ويفشل، ويحاول مرة أخرى، وتمنحه "نجمة ذهبية" (مكافأة) عندما ينجح.
- الإيجابيات: يتعلم كيفية التعامل مع المفاجات ويمكنه ابتكار طرق جديدة للقيام بالأشياء.
- السلبيات: يستغرق وقتاً طويلاً جداً. قد يصطدم بالأشياء آلاف المرات قبل أن يتعلم الحركة الصحيحة. الأمر يشبه طفلاً يتعلم المشي عن طريق السقوط المتكرر.
المشكلة
معظم مهام العالم الحقيقي تتطلب كليهما. أنت بحاجة إلى "المُقلد" للتعامل مع الأجزاء السهلة والمتوقعة (مثل تحريك ذراعك من النقطة أ إلى النقطة ب)، وتحتاج إلى "المستكشف" للتعامل مع الأجزاء الصعبة والمعقدة (مثل معرفة كيفية الإمساك بمنشفة زلقة بدقة أو إدخال قابس في مقبس ضيق).
حاولت الأساليب الموجودة دمج هذين النوعين، لكنها غالباً ما كانت ترتبك بشأن متى تستخدم أي استراتيجية، مما أدى إلى بطء التعلم أو حاجة الروبوت لتدخل بشري مستمر للإصلاح.
الحل: MoRI (خليط من خبراء التعلم التعزيزي والتعلم بالتقليد)
ابتكر مؤلفو هذه الورقة نظاماً يسمى MoRI. فكر في MoRI ليس كعقل روبوت واحد، بل كـ فريق من خبيرين يعملان معاً تحت إدارة مدير ذكي.
أعضاء الفريق
- المخضرم (خبير التعلم بالتقليد - IL Expert): هذا هو "المُقلد". هو بارع في الحركات السلسة والروتينية. يعرف تماماً كيفية فتح درج أو تحريك مكعب لأنه رأى البشر يفعلون ذلك من قبل.
- المغامر (خبير التعلم التعزيزي - RL Expert): هذا هو "المستكشف". هو جيد في اكتشاف الأشياء الصعبة وعالية الدقة حيث يمكن أن تسوء الأمور. لديه الاستعداد للمخاطرة لإيجاد الطريقة المثالية للإمساك بشيء زلق.
المدير (شبكة البوابة - The Gating Network)
هذا هو الجزء السحري. MoRI لديه مدير ذكي يراقب الخبيرين. يسأل نفسه: "ما مدى تأكدنا من الحركة التالية؟"
- إذا اتفق الخبيران (تباين منخفض): يقول المدير: "هذا سهل. دع المخضرم يقوم بالمهمة." (مثلاً: "فقط حرك الذراع نحو الدرج.")
- إذا اختلف الخبيران أو لم يكونا متأكدين (تباين مرتفع): يقول المدير: "هذا أمر صعب. دع المغامر يتولى الأمر ويكتشف الطريقة." (مثلاً: "كيف أمسك هذه المنشفة دون أن تنزلق؟")
يحدث هذا التبديل فورياً، مثل سباق التتابع حيث يتم تسليم العصا في اللحظة التي يحتاج فيها العداء للركض بأقصى سرعة.
كيف قاموا بتدريبه (خطة المرحلتين)
للتأكد من أن الفريق يعمل جيداً دون كسر الروبوت، استخدموا عملية تدريب من خطوتين:
المرحلة الأولى: الفصل الدراسي (التدريب المسبق غير المتصل - Offline Pre-training):
قبل أن يلمس الروبوت أي جسم حقيقي، قاموا بتغذيته بـ 20 فيديو لبشر يقومون بالمهام.- المخضرم حفظ هذه الفيديوهات.
- المغامر درسها ليحصل على بداية جيدة، حتى لا يبدأ من الصفر.
- تشبيه: الأمر يشبه دراسة كتاب مدرسي قبل اختبار القيادة.
المرحلة الثانية: ميدان التدريب (الضبط الدقيق المتصل - Online Fine-tuning):
الآن يذهب الروبوت إلى العالم الحقيقي.- المدير يوجه حركة المرور.
- إذا تعثر الروبوت، يقوم الإنسان بتقديم دفعة بسيطة (تدخل).
- والأهم من ذلك، يستخدم النظام "شبكة أمان" (التنظيم - Regularization). إنه يخبر المغامر: "يمكنك الاستكشاف، لكن لا تبتعد كثيراً عن المسار الذي رسمه لك المخضرم." وهذا يحافظ على سلامة الروبوت ويمنعه من الاصطدام أثناء التعلم.
النتائج: لماذا يعد هذا أمراً هاماً؟
اختبر الفريق النظام على أربع مهام صعبة في العالم الحقيقي (وضع مكعبات في أدراج، طي مناشف، إدخال قوابس، إلخ). وإليك ما حدث:
- السرعة: تعلم الروبوت في ساعتين إلى 5 ساعات. استغرقت الطرق الأخرى وقتاً أطول بكثير.
- معدل النجاح: نجح بنسبة 97.5% من المرات.
- المساعدة البشرية: احتاج إلى مساعدة بشرية بنسبة 85% أقل من الطرق الأخرى. لقد حل الروبوت معظم المشكلات بمفرده.
- السلاسة: لأن المدير يبدل بين الخبراء بسلاسة شديدة، لم تكن حركات الروبوت متقطعة أو مفاجئة.
الخلاصة
MoRI يشبه توظيف لاعب شطرنج محترف (المخضرم) ومقامر (المغامر) ووضع حكم (المدير) بينهما. يتولى لاعب الشطرنج الحركات القياسية، ويتولى المقامر المواقف غير المتوقعة، ويحرص الحكم على جعلهم يتبادلون الأدوار في اللحظة المثالية.
يسمح هذا للروبوتات بأداء مهام طويلة ومعقدة بسرعة، وأمان، وبأقل قدر من المراقبة البشرية، مما يقربنا خطوة من روبوتات يمكنها حقاً مساعدتنا في المنزل أو في المصانع.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.