Passivity-Centric Safe Reinforcement Learning for Contact-Rich Robotic Tasks
تتناول هذه الورقة البحثية قيود السلامة والاستقرار في التعلم التعزيزي التقليدي في المهام الروبوتية الغنية بالتلامس من خلال اقتراح إطار عمل يدمج التدريب المدرك لخاصية السلبية مع قيود قائمة على الطاقة ومرشح سلبية للتشغيل، مما يضمن استقرار التحكم ويحسن كفاءة الطاقة.
المؤلفون الأصليون:Heng Zhang, Gokhan Solak, Sebastian Hjorth, Arash Ajoudani
تخيل ذراعاً آلية تمتد لتلمس جداراً، ليس لدفعه بعيداً، بل لتتحسس طريقها عبر متاهة مظلمة ومتعرجة. هذا هو عالم الروبوتات القائمة على التلامس، حيث يتعين على الآلات التفاعل فيزيائياً مع محيطها لحل المشكلات. لسنوات طويلة، استخدم العلماء أداة قوية تسمى "التعلم التعزيزي" لتعليم الروبوتات كيفية القيام بذلك. فكر في الأمر كعملية تجربة وخطأ رقمية: يحاول الروبوت القيام بحركة ما، ويحصل على مكافأة إذا نجح، ويتعلم من أخطائه. وبينما حققت هذه الطريقة نتائج مبهرة في المحاكاة الحاسوبية، لا تزال هناك عقبة رئيسية عند نقل هذه الروبوتات إلى العالم الحقيقي. فالخوارزميات بارعة في إيجاد مسار للوصول إلى الهدف، لكنها غالباً ما تتجاهل قاعدة أساسية في الفيزياء: الطاقة. فإذا تعلم الروبوت استراتيجية تتطلب منه ضخ الكثير من الطاقة في مفاصله أو في البيئة المحيطة، فقد يصبح غير مستقر، أو يهتز بعنف، أو حتى يتلف نفسه والأشياء التي يلمسها. إن ضمان أن تكون حركات الروبوت آمنة ومستقرة ليس مجرد شاغل نظري؛ بل هو ضرورة عملية لأي آلة ستعمل يوماً ما جنباً إلى جنب مع البشر.
لقد وضع الباحثون في المعهد الإيطالي للتكنولوجيا في جنوة بإيطاليا، هدفاً لحل هذه المشكلة تحديداً. وقد طرحوا سؤالاً بسيطاً ولكنه حاسم: هل يمكننا تعليم الروبوت ألا يكون بارعاً في مهمة ما فحسب، بل أن يكون أيضاً آمناً بطبيعته فيما يتعلق بكيفية استخدام الطاقة؟ يركز عملهم على مفهوم يسمى "الخمول" (passivity). وبالمعنى المبسط، يعني الخمول أن النظام لا يمكنه خلق طاقة من العدم؛ بل يمكنه فقط تخزين ما يتلقاه أو تبديده. والروبوت "الخامل" هو الذي يتصرف مثل نابض جيد التخميد، يمتص الصدمات بدلاً من تضخيمها. وقد اكتشف الفريق أن سياسات التعلم التعزيزي القياسية، التي يتم تدريبها لتعظيم النجاح في المهمة، غالباً ما تفشل في احترام هذه القاعدة. ففي تجاربهم، تعلمت هذه السياسات القياسية إكمال المهام بسرعة، لكنها فعلت ذلك من خلال توليد أوامر تحكم تنتهك حدود الطاقة، مما أدى إلى عدم الاستقرار عند تشغيلها في العالم الحقيقي.
ولإصلاح ذلك، طور الباحثون نهجاً جديداً يجمع بين قدرة الذكاء الاصطناत्मक على التعلم وقواعد الطاقة الصارمة. لقد أنشأوا نظاماً يتكون من جزأين متميزين يعملان معاً. الجزء الأول يحدث أثناء مرحلة التدريب؛ حيث علموا الروبوت أن يكون "واعياً بالخمول". فبدلاً من مجرد مكافأة الروبوت للوصو إلى مخرج المتاهة، أضافوا قيوداً غير مرئية تعاقبه على استخدام الكثير من الطاقة أو تغيير صلابته بسرعة كبيرة. وقد أجبر هذا الروبوت على تعلم طريقة أكثر اقتصاداً في الحركة، واكتشاف استراتيجيات كانت بطبيعتها أكثر لطفاً واستقراراً. أما الجزء الثاني فيحدث عندما يعمل الروبوت فعلياً. فرغم التدريب الأفضل، كان الباحثون يعلمون أن برنامج الكمبيوتر قد يرتكب خطأً. لذا، أضافوا "مرشح سلامة"، وهو طبقة حماية أخيرة تقع بين دماغ الروبوت وعضلاته. يقوم هذا المرشح بمراقبة تدفق الطاقة باستمرار؛ فإذا حاول الروبوت القيام بحركة من شأنها ضخ الكثير من الطاقة في النظام، يقوم المرشح تلقائياً بتقليص تلك الحركة، مما يضمن بقاء الروبوت ضمن الحدود الآمنة.
اختبر الفريق هذه الطريقة في سيناريو مليء بالتحديات: مهمة استكشاف متاهة حيث كان على ذراع روبوتية إيجاد طريقها للخروج عن طريق لمس الجدران بشكل أعمى. وقارنوا بين أربعة أنواع مختلفة من الروبوتات: روبوت يتجاهل قواعد الطاقة تماماً، وروبوت تم تدريبه للاهتمام بالطاقة ولكن بدون مرشح سلامة، وروبوت يحتوي على مرشح سلامة ولكن تم تدريبه بدون قواعد الطاقة، وأخيراً، طريقتهم الجديدة التي تجمع بين التدريب الواعي بالطاقة ومرشح السلامة. كانت النتائج واضحة؛ فالروبوت الذي تم تدريبه بدون قواعد الطاقة استطاع إنهاء المتاهة في عمليات المحاكاة، ولكن عندما حاولوا تشغيله على روبوت فيزيائي حقيقي، فشل. لقد تحرك بعدوانية شديدة، مطبقاً قوة مفرطة عند المنعطفات، مما تسبب في فقدانه السيطرة. وفي المقابل، فإن الروبوتات التي تم تدريبها باستخدام قيود الطاقة تعلمت التحرك بشكل أكثر تحفظاً؛ لقد استغرقت وقتاً أطول قليلاً لتعلم المهمة خلال مرحلة التدريب، ولكن بمجرد تشغيلها، كانت أكثر موثوقية بكثير.
وعندما وضع الباحثون أفضل النماذج المدربة تحت الاختبار في العالم الحقيقي، كان الفرق صارخاً. فقد أتم الروبوت الذي يستخدم طريقتهم المزدوجة المتاهة بنجاح في كل تجربة، ولم ينتهك حدود القوة أو ينفد مخزونه من الطاقة أبداً. أما الروبوت القياسي، حتى مع وجود مرشح السلامة، فقد عانى لأنه لم يتعلم كيفية إدارة طاقته بكفاءة في المقام الأول. كان مرشح السلامة وحده قادراً على منع وقوع كارثة، لكنه لم يستطع جعل الروبوت فعالاً. كما أن التدريب الواعي بالطاقة وحده جعل الروبوت فعالاً، لكنه لم يستطع ضمان السلامة إذا ارتكب الروبوت خطأً مفاجئاً وغير متوقع. فقط من خلال الجمع بينهما، حققوا نظاماً يجمع بين الكفاءة والسلامة. ووجد الباحثون أن الروبوت المدرب بحدود طاقة صارمة استخدم ميزانية طاقته بشكل أبطأ وأكثر توازناً، مما سمح له بالتعامل مع المنعطفات والعقبات المعقدة دون أن تنفد طاقته.
يسلط هذا العمل الضوء على تحول جوهري في كيفية بناء الآلات الذكية. فهو يشير إلى أنه لكي تعمل الروبوتات بأمان في عالمنا المادي، لا يكفي تعليمها أن تكون ذكية فحسب، بل يجب تعليمها أن تكون مسؤولة فيزيائياً. ومن خلال دمج قوانين حفظ الطاقة مباشرة في عملية التعلم ودعمها بمرشح سلامة في الوقت الفعلي، أظهر الباحثون مساراً نحو روبوتات ليست قادرة فحسب، بل جديرة بالثقة أيضاً. وتثبت تجاربهم، التي أُجريت على ذراع روبوتية ذات سبعة مفاصل، أنه من الممكن تعليم الآلة كيفية التنقل في بيئة صعبة وكثيفة التلامس دون المخاطرة باستقرارها أو سلامة محيطها. ولا تعتمد هذه الطريقة على نماذج رياضية معقدة للعالم قد تكون خاطئة، بل تعتمد على تعلم الروبوت لحدود طاقته الخاصة من خلال التجربة، مسترشداً بقواعد تبقيه راسخاً في الواقع الفيزيائي.
أظهر التعلم المعزز (RL) نجاحاً كبيراً في التحكم الروبوتي، لكنه يواجه عوائق حرجة عند النشر في البيئات الواقعية الغنية بالتلامس. غالباً ما تعطي سياسات التعلم المعزز التقليدية الأولوية لإكمال المهمة وكفاءة التعلم مع إهمال استقرار النظام وسلامته. في السيناريوهات الغنية بالتلامس، مثل تتبع الجدران أو تنظيم القوة، يمكن للسياسات التي تفتقر إلى ضمانات السلبية (Passivity Guaranteoms) أن تؤدي إلى عدم استقرار النظام، وتراكم غير محدود للطاقة، واهتزازات عالية التردد. هذه السلوكيات تشكل مخاطر على الروبوت، والبيئة، والمشغلين البشريين.
بينما يعد التحكم القائم على السلبية (PBC) طريقة راسخة لضمان الاستقرار في التفاعلات الفيزيائية، فإن دمجه في التعلم المعزز لا يزال غير مستكشف بشكل كافٍ. تركز الأدبيات الحالية غالباً على تصميم خزانات الطاقة أو المعلمات للتحكم الكلاسيكي، مع بحث محدود في تصميم الأنظمة السلبية القائمة على التعلم. علاوة على ذلك، فإن مجرد تحديد إجمالي الطاقة ليس كافياً؛ إذ يجب أيضاً تقييد تدفق الطاقة بين المتحكم والروبوت لضمان السلبية. تحدد الورقة فجوة في الجمع بين التعلم المعزز والتحكم القائم على السلبية لمعالجة السلامة والاستقرار وكفاءة الطاقة في مهام التلامس في آن واحد.
المنهجية
يقترح المؤلفون إطار عمل للتعلم المعزز الآمن المضمن السلبية يدمج قيوداً قائمة على الطاقة في كل من مرحلتي التدريب والنشر. يعتمد النهج على نموذج أساسي للتعلم المعزز الآمن يستخدم التحكم في الممانعة المتغيرة (VIC) وناقد سلامة للمهام الغنية بالتلامس. تميز المنهجية بين أربعة نهج:
غير المرتكز على السلبية (Passivity-Agnostic): تعلم معزز قياسي دون اعتبارات السلبية.
المفلتر بالسلبية (Passivity-Filtered): تعلم معزز يتم تدريبه تقليدياً، مع تطبيق فلتر السلبية عند النشر.
الواعي بالسلبية (Passivity-Aware): تعلم معزز مدرب بقيود صريحة على الطاقة لتعلم سلوك سلبي.
المضمن بالسلبية (Passivity-Ensured): مزيج من التدريب الواعي بالسلبية وفلتر السلبية عند النشر.
المكونات الأساسية
خزان الطاقة المعزز: يستخدم النظام خزان طاقة (ET) لتخزين وتحديد الطاقة. وعلى عكس الأعمال السابقة التي كانت تكتفي بوضع حدود لإجمالي الطاقة، يقدم هذا الأسلوب حداً للتدفق (E˙T) لتقييد معدل حقن الطاقة، مما يعالج عدم كفاية تحديد إجمالي الطاقة وحده.
التدريب الواعي بالسلبية (القسم 2.4): تم توسيع عملية اتخاذ القرار الماركوفية المقيدة (CMDP) لتشمل قيدين جديدين:
قيد الميزانية (ceb): يتم تفعيله إذا انخفض خزان الطاقة عن حد أدنى (ET≤ET).
قيد التدفق (cef): يتم تفعيله إذا تجاوز معدل استنزاف الطاقة حداً معيناً (E˙T<E˙T). تُستخدم هذه القيود لتدريب ناقد السلامة، مما يمكّن الوكيل من تعلم سياسات أكثر كفاءة في استهلاك الطاقة دون الحاجة لزيادة مساحة الحالة بمتغيرات الخزان، مما يحافظ على ضغط الحالة.
التحكم المضمن بالسلبية (القسم 2.5): يتم تطبيق طبقة سلبية على مخرجات التعلم المعزز أثناء النشر. تعمل هذه الطبقة كفلتر:
تحسب عامل القياس α بناءً على نسبة تدفق الطاقة المسموح به إلى التدفق الفعلي.
إذا نفد خزان الطاقة، يتم إيقاف أو تعديل تحديثات الصلابة لمنع المزيد من حقن الطاقة، مما يضمن بقاء النظام سلبياً.
المساهمات الرئيسية
تحدد الورقة ثلاث مساهمات رئيسية:
مقارنة منهجية: مقارنة واسعة النطاق لمختلف مناهج تعلم التحكم السلبي القائمة على التعلم المعزز (غير المرتكز على السلبية، المفلتر بالسلبية، الواعي بالسلبية، والمضمن بالسلبية)، وتقييم آثارها على التدريب، والنشر، والسلامة، والاستقرار، وكفاءة الطاقة.
صياغة السلبية المعززة: تصميم وتقييم صياغة سلبية معززة تعتمد على خزان الطاقة ضمن التعلم المعزز، وتتضمن تحديداً أحجاماً متغيرة لخزان الطاقة، والأهم من ذلك، قيود تدفق الطاقة.
إطار العمل المضمن بالسلبية: تقديم إطار عمل يعالج في آن واحد سلبية التحكم وسلامة التلامس من خلال الجمع بين التدريب الواعي بالسلبية وفلتر السلبية في وقت النشر.
النتائج التجريبية
تم تقييم الطريقة في مهمة استكشاف متاهة غنية بالتلامس حيث يجب على الروبوت التنقل في متاهة غير معروفة عبر لمس الجدران بشكل أعمى، مما يتطلب تنظيماً دقيقاً للقوة. أُجريت التجارب في محاكاة MuJoCo وعلى ذراع روبوت حقيقي من نوع Franka Panda.
مرحلة التدريب
تأثير القيود: أثرت قيود السلبية (ceb و cef) بشكل مباشر على معدلات نجاح المهمة أثناء التدريب. وبينما أعاقت القيود شديدة التقييد (مثل حدود التدفق الضيقة) الاستكشاف والنجاح في البداية، إلا أنها أجبرت الوكيل على تعلم سلوكيات أكثر تحفظاً وكفاءة في استهلاك الطاقة.
ديناميكيات التعلم: تعلمت الوكلاء المدربة بقيود الطاقة (مثل Eb4) تنظيم الصلابة بشكل أكثر اقتصاداً، مما أدى إلى تقليل وتوزيع أكثر توازناً لإنفاق الطاقة مقارنة بالوكلاء غير المرتكزين على السلبية.
مرحلة النشر (المحاكاة والواقع الحقيقي)
ضمان الاستقرار: كان النهج المضمن بالسلبية (التدريب الواعي بالسلبية + فلتر السلبية) هو الطريقة الوحيدة لضمان سلبية النظام. فالسياسات غير المرتكزة على السلبية، حتى لو نجحت في إكمال المهمة، كثيراً ما انتهكت قيود الطاقة وأظهرت استخداماً عدوانياً للطاقة.
الأداء مقابل الكفاءة:
غير المرتكز على السلبية: حقق نجاحاً عالياً في المهمة بمعزل عن العوامل الأخرى، لكنه استنفد ميزانيات الطاقة بسرعة وفشل في التجارب الواقعية بسبب تطبيق القوة العدوانية.
المضمن بالسلبية: حقق معدل نجاح بنسبة 100% في التجارب الواقعية دون أي انتهاكات للقيود. وبينما كانت بعض السياسات المقيدة (مثل Eb4) تتقارب ببطء أكبر في التدريب، إلا أنها أظهرت كفاءة فائقة في استهلاك الطاقة ومتانة في النشر.
التحقق في العالم الحقيقي: في التجارب الواقعية، فشل نموذج الأساس غير المرتكز على السلبية في تجربة واحدة من أصل ثلاث تجارب بسبب القوة المفرطة عند نقطة دوران. نجحت جميع التكوينات المضمنة بالسلبية دون انتهاك قيود القوة أو الطاقة. وأكد تحليل استهلاك الطاقة أن السياسات الواعية بالسلبية حافظت على معدلات استهلاك طاقة أقل من النموذج غير المرتكز على السلبية.
الأهمية والادعاءات
تدعي الورقة أن سياسات التعلم المعزز التقليدية غير كافية للمهام الغنية بالتالت بسبب افتقارها لضمانات الاستقرار المتأصلة. يعالج إطار التعلم المعزز الآمن المضمن بالسلبية المقترح ذلك من خلال:
ضمان الاستقرار: يضمن فلتر السلبية في وقت النشر بقاء النظام سلبياً بغض النظر عن مخرجات التعلم المعزز، مما يمنع عدم الاستقرار والسلوكيات غير الآمنة.
تحسين كفاءة الطاقة: من خلال تدريب الوكيل صراحةً بقيود الطاقة، يتعلم النظام استخدام الطاقة بشكل أكثر اقتصاداً، مما يؤدي إلى أداء أفضل في المهام المعقدة وطويلة الأمد.
سد الفجوة: يوضح العمل أن الجمع بين تحسين السياسة القائم على التعلم وصيغ السلبية الكلاسيكية هو مسار قابل للتطبيق لنشر روبوتي آمن ومستقر وفعال في البيئات غير المنظمة والغنية بالتلامس.
يخلص المؤلفون إلى أنه بينما يحسن التدريب الواعي بالسلبية من كفاءة الطاقة، فإن فلتر السلبية ضروري لضمان السلامة أثناء النشر، حيث لا يمكن للتعلم وحده ضمان السلبية الصارمة بسبب الطبيعة العشوائية للتعلم المعزز وعدم اكتمال البيانات.