← أحدث الأبحاث
💻 computer science

Passivity-Centric Safe Reinforcement Learning for Contact-Rich Robotic Tasks

تتناول هذه الورقة البحثية قيود السلامة والاستقرار في التعلم التعزيزي التقليدي في المهام الروبوتية الغنية بالتلامس من خلال اقتراح إطار عمل يدمج التدريب المدرك لخاصية السلبية مع قيود قائمة على الطاقة ومرشح سلبية للتشغيل، مما يضمن استقرار التحكم ويحسن كفاءة الطاقة.

المؤلفون الأصليون: Heng Zhang, Gokhan Solak, Sebastian Hjorth, Arash Ajoudani

نُشر 2026-09-03
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Heng Zhang, Gokhan Solak, Sebastian Hjorth, Arash Ajoudani

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل ذراعاً آلية تمتد لتلمس جداراً، ليس لدفعه بعيداً، بل لتتحسس طريقها عبر متاهة مظلمة ومتعرجة. هذا هو عالم الروبوتات القائمة على التلامس، حيث يتعين على الآلات التفاعل فيزيائياً مع محيطها لحل المشكلات. لسنوات طويلة، استخدم العلماء أداة قوية تسمى "التعلم التعزيزي" لتعليم الروبوتات كيفية القيام بذلك. فكر في الأمر كعملية تجربة وخطأ رقمية: يحاول الروبوت القيام بحركة ما، ويحصل على مكافأة إذا نجح، ويتعلم من أخطائه. وبينما حققت هذه الطريقة نتائج مبهرة في المحاكاة الحاسوبية، لا تزال هناك عقبة رئيسية عند نقل هذه الروبوتات إلى العالم الحقيقي. فالخوارزميات بارعة في إيجاد مسار للوصول إلى الهدف، لكنها غالباً ما تتجاهل قاعدة أساسية في الفيزياء: الطاقة. فإذا تعلم الروبوت استراتيجية تتطلب منه ضخ الكثير من الطاقة في مفاصله أو في البيئة المحيطة، فقد يصبح غير مستقر، أو يهتز بعنف، أو حتى يتلف نفسه والأشياء التي يلمسها. إن ضمان أن تكون حركات الروبوت آمنة ومستقرة ليس مجرد شاغل نظري؛ بل هو ضرورة عملية لأي آلة ستعمل يوماً ما جنباً إلى جنب مع البشر.

لقد وضع الباحثون في المعهد الإيطالي للتكنولوجيا في جنوة بإيطاليا، هدفاً لحل هذه المشكلة تحديداً. وقد طرحوا سؤالاً بسيطاً ولكنه حاسم: هل يمكننا تعليم الروبوت ألا يكون بارعاً في مهمة ما فحسب، بل أن يكون أيضاً آمناً بطبيعته فيما يتعلق بكيفية استخدام الطاقة؟ يركز عملهم على مفهوم يسمى "الخمول" (passivity). وبالمعنى المبسط، يعني الخمول أن النظام لا يمكنه خلق طاقة من العدم؛ بل يمكنه فقط تخزين ما يتلقاه أو تبديده. والروبوت "الخامل" هو الذي يتصرف مثل نابض جيد التخميد، يمتص الصدمات بدلاً من تضخيمها. وقد اكتشف الفريق أن سياسات التعلم التعزيزي القياسية، التي يتم تدريبها لتعظيم النجاح في المهمة، غالباً ما تفشل في احترام هذه القاعدة. ففي تجاربهم، تعلمت هذه السياسات القياسية إكمال المهام بسرعة، لكنها فعلت ذلك من خلال توليد أوامر تحكم تنتهك حدود الطاقة، مما أدى إلى عدم الاستقرار عند تشغيلها في العالم الحقيقي.

ولإصلاح ذلك، طور الباحثون نهجاً جديداً يجمع بين قدرة الذكاء الاصطناत्मक على التعلم وقواعد الطاقة الصارمة. لقد أنشأوا نظاماً يتكون من جزأين متميزين يعملان معاً. الجزء الأول يحدث أثناء مرحلة التدريب؛ حيث علموا الروبوت أن يكون "واعياً بالخمول". فبدلاً من مجرد مكافأة الروبوت للوصو إلى مخرج المتاهة، أضافوا قيوداً غير مرئية تعاقبه على استخدام الكثير من الطاقة أو تغيير صلابته بسرعة كبيرة. وقد أجبر هذا الروبوت على تعلم طريقة أكثر اقتصاداً في الحركة، واكتشاف استراتيجيات كانت بطبيعتها أكثر لطفاً واستقراراً. أما الجزء الثاني فيحدث عندما يعمل الروبوت فعلياً. فرغم التدريب الأفضل، كان الباحثون يعلمون أن برنامج الكمبيوتر قد يرتكب خطأً. لذا، أضافوا "مرشح سلامة"، وهو طبقة حماية أخيرة تقع بين دماغ الروبوت وعضلاته. يقوم هذا المرشح بمراقبة تدفق الطاقة باستمرار؛ فإذا حاول الروبوت القيام بحركة من شأنها ضخ الكثير من الطاقة في النظام، يقوم المرشح تلقائياً بتقليص تلك الحركة، مما يضمن بقاء الروبوت ضمن الحدود الآمنة.

اختبر الفريق هذه الطريقة في سيناريو مليء بالتحديات: مهمة استكشاف متاهة حيث كان على ذراع روبوتية إيجاد طريقها للخروج عن طريق لمس الجدران بشكل أعمى. وقارنوا بين أربعة أنواع مختلفة من الروبوتات: روبوت يتجاهل قواعد الطاقة تماماً، وروبوت تم تدريبه للاهتمام بالطاقة ولكن بدون مرشح سلامة، وروبوت يحتوي على مرشح سلامة ولكن تم تدريبه بدون قواعد الطاقة، وأخيراً، طريقتهم الجديدة التي تجمع بين التدريب الواعي بالطاقة ومرشح السلامة. كانت النتائج واضحة؛ فالروبوت الذي تم تدريبه بدون قواعد الطاقة استطاع إنهاء المتاهة في عمليات المحاكاة، ولكن عندما حاولوا تشغيله على روبوت فيزيائي حقيقي، فشل. لقد تحرك بعدوانية شديدة، مطبقاً قوة مفرطة عند المنعطفات، مما تسبب في فقدانه السيطرة. وفي المقابل، فإن الروبوتات التي تم تدريبها باستخدام قيود الطاقة تعلمت التحرك بشكل أكثر تحفظاً؛ لقد استغرقت وقتاً أطول قليلاً لتعلم المهمة خلال مرحلة التدريب، ولكن بمجرد تشغيلها، كانت أكثر موثوقية بكثير.

وعندما وضع الباحثون أفضل النماذج المدربة تحت الاختبار في العالم الحقيقي، كان الفرق صارخاً. فقد أتم الروبوت الذي يستخدم طريقتهم المزدوجة المتاهة بنجاح في كل تجربة، ولم ينتهك حدود القوة أو ينفد مخزونه من الطاقة أبداً. أما الروبوت القياسي، حتى مع وجود مرشح السلامة، فقد عانى لأنه لم يتعلم كيفية إدارة طاقته بكفاءة في المقام الأول. كان مرشح السلامة وحده قادراً على منع وقوع كارثة، لكنه لم يستطع جعل الروبوت فعالاً. كما أن التدريب الواعي بالطاقة وحده جعل الروبوت فعالاً، لكنه لم يستطع ضمان السلامة إذا ارتكب الروبوت خطأً مفاجئاً وغير متوقع. فقط من خلال الجمع بينهما، حققوا نظاماً يجمع بين الكفاءة والسلامة. ووجد الباحثون أن الروبوت المدرب بحدود طاقة صارمة استخدم ميزانية طاقته بشكل أبطأ وأكثر توازناً، مما سمح له بالتعامل مع المنعطفات والعقبات المعقدة دون أن تنفد طاقته.

يسلط هذا العمل الضوء على تحول جوهري في كيفية بناء الآلات الذكية. فهو يشير إلى أنه لكي تعمل الروبوتات بأمان في عالمنا المادي، لا يكفي تعليمها أن تكون ذكية فحسب، بل يجب تعليمها أن تكون مسؤولة فيزيائياً. ومن خلال دمج قوانين حفظ الطاقة مباشرة في عملية التعلم ودعمها بمرشح سلامة في الوقت الفعلي، أظهر الباحثون مساراً نحو روبوتات ليست قادرة فحسب، بل جديرة بالثقة أيضاً. وتثبت تجاربهم، التي أُجريت على ذراع روبوتية ذات سبعة مفاصل، أنه من الممكن تعليم الآلة كيفية التنقل في بيئة صعبة وكثيفة التلامس دون المخاطرة باستقرارها أو سلامة محيطها. ولا تعتمد هذه الطريقة على نماذج رياضية معقدة للعالم قد تكون خاطئة، بل تعتمد على تعلم الروبوت لحدود طاقته الخاصة من خلال التجربة، مسترشداً بقواعد تبقيه راسخاً في الواقع الفيزيائي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →