Contact-Guided Exploration for Non-Prehensile Locomanipulation with Multi-Critic RL
تقترح هذه الورقة استراتيجية استكشاف موجهة بالتلامس ضمن إطار عمل التعلم التعزيزي متعدد النقاد للتغلب على تحديات الديناميكيات الهجينة المعقدة والتلامس الشحيح في المناولة غير القابضة، حيث نجحت في استعراض مهارات قابلة للنشر لمهام مثل نقل الكرسي على روبوت متنقل رباعي الأرجل بمانيبوليتور في العالم الحقيقي.
المؤلفون الأصليون:Simone Tolomei, Mayank Mittal, Franco Angelini, Manolo Garabini, Paolo Salaris, Marco Hutter
لطالما كانت الروبوتات أسياداً في أرض المصنع، حيث ترفع الأجزوال الثقيلة وتضعها بدقة متناهية. ولكن بمجرد الخروج من تلك البيئة المحكومة إلى منزل أو مستودع، تتغير القواعد. هنا، غالباً ما تكون الأشياء إما ثقيلة جداً بحيث لا يمكن رفعها، أو غير مريحة بحيث لا يمكن الإمساك بها بقبضة يدوية. ولتحريك كرسي ذراع ضخم أو صندوق كبير، لا يمكن للروبوت ببساطة أن يرفعه؛ بل يجب عليه أن يدفعه، أو يسحبه، أو يزلقه عبر الأرض. يُعرف هذا بـ "التلاعب غير القبضي" (non-prehensile manipulation). وهي مهارة صعبة لأن الفيزياء فيها فوضوية؛ فخلافاً للإمساك بجسم ما، حيث يكون الاتصال صلباً، يعتمد الدفع على الاحتكاك وزاوية التلامس. إذا دفع الروبوت بزاوية خاطئة، فقد ينزلق الجسم بعيداً، أو ينقلب، أو قد يفقد الروبوت توازنه هو نفسه. لسنوات، كافح المهندسون لتعليم الروبوتات كيفية التنقل في هذه الرقصة الدقيقة من التلامس دون الاصطدام أو الفشل في تحريك الجسم تماماً.
قام فريق من الباحثين الآن بتطوير طريقة جديدة لتعليم الروبوتات هذه المهارات، باستخدام منهجية توجه عملية تعلم الروبوت منذ البداية. فبدلاً من ترك الروبوت يخمن عشوائياً حتى يجد بالصدفة طريقة لدفع جسم ما، أعطاه الباحثون خريطة توضح أماكن اللمس. لقد استخدموا خوارزمية حاسوبية لتحديد أكثر الأماكن منطقية على الجسم لإجراء الاتصال، مثل أرجل الكرسي أو مقبض غسالة الأطباق. ثم بنوا نظام تدريب يكافئ الروبوت على العثور على هذه النقاط المحددة. ومع ذلك، أدركوا أنه إذا كان الروبوت يهتم فقط بلمس النقطة الصحيحة، فقد لا يتعلم أبداً كيفية تحريك الجسم بالفعل إلى وجهته. ولحل هذه المشكلة، ابتكروا جدولاً زمنياً للتعلم يبدأ بالتركيز بشدة على إيجاد نقطة التلامس، ثم يتلاشى هذا التركيز تدريجياً، مما يجبر الروبوت على تعلم كيفية تحريك الجسم بكفاءة بمجرد إنشاء قبضة جيدة.
اختبر الباحثون هذا النهج على روبوت رباعي الأرجل مزود بذراع، وهو آلة مصممة للتنقل في التضاريس الوعرة أثناء التعامل مع الأشياء. وفي عمليات المحاكاة، تعلم الروبوت دفع الصناديق ونقل الكراسي إلى مواقع محددة. وأظهرت النتائج أنه بدون هذا النهج الموجه، غالباً ما يفشل الربو في لمس الجسم حتى، أو يدفعه بطريقة تؤدي إلى انقلابه. وباستخدام طريقتهم، نجح الروبوت في تحريك الأشياء في أكثر من تسعين بالمائة من التجارب. والأهم من ذلك، تعلم الروبوت تعديل جسده وذراعه للحفاظ على استقرار الجسم، وغالباً ما كان يخفض مركز جاذبيته لمنع الأثاث الثقيل من السقوط.
جاء الاختبار الحقيقي عندما نقل الباحثون الروبوت من الحاسوب إلى العالم الحقيقي. فقد وضعوا الروبوت أمام كراسي متنوعة لم يرهَا من قبل، بما في ذلك بعض الكراسي ذات الثلاث أرجل وأخرى ذات آليات طي. ورغم الاختلافات في الشكل والوزن، نجح الروبوت في دفع وسحبها إلى أهدافها. وفي إحدى التجارب، أضافوا وزناً إضافياً إلى كرسي، مما جعله أثقل مما هو مصنف تقنياً أن يحمله ذراع الروبوت. ومع ذلك، تمكن الروبوت من تحريكه باستخدام أرجله والأرض لتوفير الدعم، مما أثبت أنه تعلم استخدام جسده بالكامل للقيام بالعمل. كما أظهر الروبوت قدرة على التعافي من الأخطاء؛ فإذا انزلق أو فقد الاتصال، فإنه يعيد تموضع نفسه تلقائياً ويحاول مرة أخرى دون توقف.
طبق الباحثون أيضاً هذه التقنية على مهمة أكثر تعقيداً: فتح غسالة الأطباق. هذا الجسم يحتوي على أجزاء متحركة، مما يتطلب من الروبوت أولاً الإمساك بالمقبض ثم الانتقال إلى دفع لوحة الباب أثناء انفتاحها. تعلم الروبوت تحديد المقبض كنقطة انطلاق، ثم الانتقال بسلاسة إلى دفع الباب حتى يفتح بالكامل. وقد أظهر هذا أن الطريقة يمكنها التعامل مع الأشياء التي يتغير شكلها أثناء المهمة، وليس فقط الكتل الثابتة. تشير الدراسة إلى أنه من خلال توجيه فضول الروبوت الأولي نحو نقاط تلامس ذات مغزى ثم تركه تدريجياً ليكتشف الباقي، يمكن للمهندسين تعليم الآلات كيفية التعامل مع الأشياء الثقيلة، والمزعجة، وغير المتوقعة الموجودة في حياتنا اليومية. وبينما لا يزال النظام يعتمد على كاميرات خارجية لتتبع موقع الجسم، فقد أثبتت استراتيجية التعلم الجوهرية أنها قوية بما يكفي للتعامل مع الاختلافات في الوزن والشكل والاحتكاك في العالم الحقيقي، مما يقربنا خطوة من روبوتات يمكنها حقاً المساعدة في الأعمال الشاقة في منازلنا.
ملخص تقني: الاستكشاف الموجه بالتلامس للتحكم في الموقع عبر التلاعب غير القابض باستخدام التعلم المعزز متعدد النقاد
بيان المشكلة يوفر التلاعب غير القابض (الدفع، السحب، الانزلاق) بالاقتران مع المنصات المتنقلة حلاً متعدد الاستخدامات لنقل الأجسام الثقيلة أو الضخمة في البيئات غير المهيكلة. ومع ذلك، فإن التحكم في هذه التفاعلات يمثل تحدياً نظراً للطبيعة الهجينة للديناميكيات، التي تعتمد على قيود تلامس أحادية الجانب ومخاريط الاحتكاك بدلاً من القبض الصلب. وبينما يوفر التعلم المعزز العميق (DRL) بديلاً خالياً من النموذج للتحكم التنبئي بالنماذج (MPC) التقليدي، فإنه يواجه "عنق زجاجة في الاستكشاف" في مهام التلاعب بالموقع. ففي هذه المهام ذات الأفق الطويل، نادراً ما يؤدي الاستكشاف العشوائي إلى تلامس صالح، مما يؤدي إلى مكافآت متفرقة. ونتيجة لذلك، غالباً ما تتقارب الوكلاء نحو حلول محلية تتجنب التلامس تماماً لتقليل استهلاك الطاقة أو عقوبات الحركة، مما يؤدي إلى الفشل في تعلم مهارات التفاعل الضرورية. علاوة على ذلك، تعاني الطرق الحالية من التعامل مع هندسات الأجسام المعقدة وغير المحدبة حيث تؤدي عينات السطح الموحدة إلى نقاط تلامس غير ممكنة حركياً.
المنهجية يقترح المؤلفون استراتيجية استكشاف موجه بالتلامس يتم تنفيذها ضمن إطار عمل التعلم المعزز متعدد النقاد (Multi-Critic RL). هيكلية النظام الأساسية وعملية التدريب كالتالي:
أولويات التلامس المتمحورة حول الجسم: بدلاً من أخذ العينات الموحدة، يستخدم النظام خوارزمية قبض عامة لتوليد مجموعة من نقاط التفاعل المرشحة (مثل أرجل الكرسي، المقابض) على شبكة الجسم (mesh). خلال حلقات التدريب، يتم أخذ عينة من نقطة تلامس مستهدفة محددة من هذه المجموعة لتوجيه النها الطرفية (end-effector).
بنية متعددة النقاد: يستخدم إطار العمل عموداً فقرياً مشتركاً مع ثلاثة رؤوس نقاد متخصصة تقابل مجموعات المكافآت المختلفة:
مكافأة المهمة (rtask): تركز على تحقيق الهدف (موضع الجسم وسرعته).
مكافأة الاستكشاف (rexp): مكافأة كثيفة تشجع النها الطرفية على الوصول إلى نقطة التلامس المختارة.
مكافأة التنظيم (rreg): تعاقب الحركات المفاجئة، واستهلاك الطاقة، وانتهاكات حدود المفاصل (مثل ارتفاع الخطاف).
خلط المزايا الموزون: يتم تحديث السياسة باستخدام دالة مزايا مركبة، At=∑whAth، حيث تمثل wh وزن كل مجموعة مكافأة.
جدول الاضمحلال: مكون حاسم هو الجدولة الديناميكية لأوزان النقاد. يتم تقليل وزن الاستكشاف (wexp) خطياً من 0.1 إلى 0.01 خلال المراحل الأولى من التدريب (الخطوات 5k–10k)، بينما يزدير وزن التنظيم. هذا يجبر السياسة على إعطاء الأولوية في البداية لإيجاد تلامس ذي معنى، ثم الانتقال تدريجياً إلى تحسين أداء المهمة والاستقرار، مما يفصل مرحلة الاستكشاف عن هدف المهمة النهائي.
التحكم في النظام: تخرج السياسة عالية المستوى مواضع مفاصل الذراع المستهدفة، وسرعة القاعدة، وارتفاع القاعدة. يتم تعديل ارتفاع القاعدة بنشاط لمنع الوصول إلى حدود مفصل الكتف عند تمدد الذراع للأسفل. يتم التعامل مع أوامر الأرجل منخفضة المستوى بواسطة سياسة تنقل مدربة مسبقاً ومجمدة.
المساهمات الرئيسية
استراتيجية الاستكشاف الموجه بالتلامس: نهج مبتكر يوجه استكشاف التعلم المعزز نحو مناطق التفاعل ذات المعنى باستخدام أولويات متمحورة حول الجسم مشتقة من خوارزميات القبض، بدلاً من الاعتماد على أخذ العينات الموحدة أو العروض الخبيرة.
صيغة متعدد النقاد مع الاضمحلال: تنفيذ ناقد استكشاف مخصص يتضاءل تأثيره تدريجياً. يسمح هذا للوكيل بتعلم سلوكيات غنية بالتلامس في وقت مبكر، ثم صقلها لتصبح سياسة قوية ومثلى للمهمة دون الارتباط بسلوكيات استكشاف غير مثالية.
التقييم المنهجي والتحقق من الأجهزة: تقييم واسع النطاق عبر مهام دفع الصناديق، ونقل الكراسي، وفتح غسالات الأطباق. والأهم من ذلك، تم التحقق من سياسة نقل الكرسي على روبوت متنقل رباعي الأرجل (ALMA) في العالم الحقيقي، مما أظهر تعميماً صفرياً (zero-shot) على هندسات وأوزان أجسام غير مرئية.
النتائج
أداء المحاكاة: حققت الطريقة المقترحة (Multi-Critic PPO + Weight Schedule) معدل نجاح قدره 94.1% في نقل الكرسي، متفوقة بشكل كبير على PPO القياسي (الذي عانى من معدلات عالية في "فشل التلامس") وعلى نماذج Multi-Critic ذات الأوزان الثابتة (التي عانت من معدلات أعلى في "الانقلاب" بسبب حوافز الاستكشاف المستمرة).
تحليل نمط الفشل: عالجت الطريقة بفعالية مشكلة "فشل التلامس" (بتقليلها إلى مستويات مهملة) وقللت من أحداث "الانقلاب" (4.4%) مقارنة بالنماذج المرجعية التي عانت من تعلم غير مستقر أو حلول محلية.
النشر في العالم الحقيقي: على الروبوت ALMA، حققت السياسة معدل نجاح إجمالي قدره 69.0% عبر أربعة أجسام غير مرئية من ايكيا (بما في ذلك كرسي قابل للطي وطاولة ثلاثية الأرجل). أظهر النظام:
التعميم: النجاح في التعامل مع الهندسات غير المتماثلة وغير القياسية دون ضبط دقيق.
التعافي التفاعلي: القدرة على إعادة التخطيط ذاتياً وإعادة إنشاء التلامس بعد الانزلاق أو المحاولة الفاشلة.
التعامل مع حمولة عالية: النجاح في نقل كرسي مع إضافة حمولة 5 كجم (إجمالي 6.5 كجم)، وهو ما يتجاوز الحمولة الساكنة المقدرة للذراع عبر الاستفادة من دعم الأرض وديناميكيات القاعدة المتنقلة.
رفض الاضطرابات: التعافي من الدفع الفيزيائي أثناء النقل.
الأجسام المفصلية: في مهمة فتح غسالة الأطباق، تعلمت السياسة تسلسل التلامس ديناميكياً، حيث انتقلت من المقبض إلى لوحة الباب مع تغير الحركية، مما قلل الوقت الذي قضته الذراع بالقرب من حدود المفاصل بنسبة 59% مقارنة بـ PPO القياسي.
الأهمية يزعم البحث أن هذا النهج يعالج الصعوبة الجوهرية للمكافآت المتفرقة في التلاعب بالموقع غير القابض من خلال هيكلة عملية التعلم. ومن خلال فصل الاستكشاف وأهداف المهمة عبر بنية متعددة النقاد مع جدول اضمحلال، يتجنب النظام المقايضة بين تجنب العقوبات وإيجاد التلامس. يوضح العمل أن التلاعب الغني بالتلامس والمهام الشاقة يمكن تعلمها من الصفر دون عروض خبيرة، محققاً أداءً قوياً في المحاكاة وسلوكيات قابلة للنشر على الأجهزة الفيزيائية مع هياكل وأوزان أجسام متنوعة. ويشير المؤلفون إلى أنه بينما النتائج واعدة، فإن الاعتماد على التقاط الحركة الخارجي يحد من النشر الميداني، وسوف يستكشف العمل المستقبلي مناهج تكيفية قائمة على الأداء لتقليل الحساسية تجاه المعلمات الفائقة (hyperparameters).