CALOS: Control-Affine Lyapunov On-manifold Safety Layer for Safe Deep Reinforcement Learning for Quadrotors
تقدم الورقة البحثية CALOS، وهو طبقة سلامة تعتمد على دالة ليابونوف (Lyapunov) ذات بنية تآلفية تحكمية (control-affine) وتعمل في الوقت الفعلي لفرض قيود وضعية الطائرة الرباعية عبر برنامج تربيعي قابل للحل بكفاءة، مما يؤدي إلى القضاء على انتهاكات السلامة، وتقليل أخطاء التتبع، وتسريع تقارب التعلم التعزيزي العميق دون تعديل السياسة الأساسية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: CALOS – طبقة سلامة على المنوع (On-manifold) تعتمد على ليابونوف والتحكم الأفيني (Control-Affine)
بيان المشكلة
أظهر التعلم المعزز العميق (DRL) قدرة كبيرة في التحكم في الطائرات بدون طيار (الدرونز)، ومع ذلك، تفتقر السياسات المتعلمة إلى ضمانات رسمية بشأن قيود السلامة أثناء التدريب أو النشر. تواجه أساليب التعلم المعزز العميق الآمنة الحالية توتراً مستمراً: فعمليات ماركوف لاتخاذ القرار المقيد (CMDPs) يمكن أن تؤدي إلى زعزعة استقرار التعلم، بينما قد تؤدي المرشحات وقت التشغيل (مثل الدروع أو دوال حاجز التحكم) إلى إضعاف إشارات التدرج إذا قامت بتصحيح الأفعال بشكل عدواني للغاية. علاوة على ذلك، تمنع القيود الهيكلية الحالية التحسين المشترك لشهادات سلامة متعددة. فالأسالط التي تستخدم طريقة ATACOM تقوم بإسقاط الأفعال على مناوع القيود ولكنها تفتقر إلى الشهادات القائمة على الطاقة لتبديد الدوران، بينما تتعامل الطرق القائمة على ليابونوف مع القيود بشكل مستقل، مما يخاطر بانتهاك أحد القيود أثناء تلبية قيد آخر. كما أن التركيب المتسلسل لهذه الأساليب يفشل في ضمان الجدوى المشتركة، لا سيالما عندما تتطلب أخطاء التتبع الكبيرة أقصى سلطة تحكم، حيث يمكن للقياس المتسلسل أن يبطل هذه السلطة.
المنهجية
تقترح الورقة البحثية CALOS (السلامة على المنوع القائمة على ليابونوف والتحكم الأفيني)، وهي طبقة سلامة تعمل وقت التشغيل وتعمل بشفافية فوق سياسة التعلم المعزز العميق القياسية (تحديداً خوارزمية PPO) دون تعديل خوارزمية التعلم الأساسية. يقوم CALOS بتوحيد قيود ميل الوضعية (Attitude-tilt) وشرط استقرار ليابونوف في مسألة برمجة تربيعية (QP) واحدة لحساب أقل تصحيح للمعيار (minimum-norm correction) لمخرجات عزم الدوران الاسمية.
قيود الميل (التنبؤ بإسقاط الميل):
يتم تمثيل الوضعية باستخدام متجه الجاذبية في الإطار المرجعي للجسم () لتجنب تفردات زوايا أويلر. وباستخدام تقريب "إيولر الرمزي" (Symplectic Euler)، يتم نمذجة متجه الجاذبية المستقبلي كدالة تآلفية لعزم دوران التحكم. يسمح هذا الصياغة بفرض حدود الالتفاف (roll) والميل (pitch) () كأربعة متباينات خطية ().قيد ليابونوف:
يتم تعريف دالة مرشحة لليابونوف بناءً على خطأ الميل والسرعة الزاوية. تفرض الطبقة شرط التحلل ، والذي يترجم، نظراً للطبيعة الأفينية للتحكم في الديناميكيات الدورانية، إلى متباينة خطية واحدة (). يضمن هذا تبديد الطاقة الدورانية.الصياغة الموحدة:
على عكس الأساليب المتسلسلة التي تطبق إسقاط الميل متبوعاً بمقياس ليابونوف (والذي قد يؤدي إلى إبطال عزم الدوران عندما تكون الأخطاء كبيرة)، يقوم CALOS بتجميع خمسة قيود خطية (أربعة للميل وواحد لليابونوف) في نظام واحد. تحل طبقة السلامة المسألة التالية:
حيث هو عزم الدوران الاسمي الناتج عن السياسة.المعالجات (Solvers):
- CALOS-P: تقريب إسقاطي باستخدام تصحيح شبه معكوس مخمد. يفرض جميع القيود بشكل مشترك دون ضمان الحل الأدنى للمعيار بدقة، مع إعطاء الأولوية للسرعة من أجل التدريب المتوازي واسع النطاق.
- CALOS-QP: معالج دقيق يستغل فضاء عزم الدوران ثلاثي الأبعاد. يقوم بحصر جميع المجموعات النشطة المحتملة (26 مرشحاً) لإيجاد الحل الأدنى للمعيار الدقيق الذي يحقق شروط كاروش-كون-تاكر (KKT). وفي حال عدم وجود حل ممكن، يعود النظام إلى فعل السياسة غير المصحح مع تقليم المشغلات (actuator clamping).
المساهمات الرئيسية
- طبقة سلامة موحدة: أول طبقة وقت تشغيل تقوم بتحسين قيود الميل واستقرار ليابونوف بشكل مشترك في خطوة برمجة تربيعية (QP) واحدة، مما يتجنب مشاكل الجدوى الناتجة عن التركيب المتسلسل.
- القابلية للتوسع في الوقت الفعلي: المعالج الدقيق (CALOS-QP) فعال حاسوبياً بما يكفي للعمل عبر آلاف بيئات المحاكاة المتوازية، وهو مطلب ضروري لتدريب التعلم المعزز العميق المتوازي الضخم.
- صفر انتهاكات في مسارات التدريب: يفرض المنهج القيود بصرامة أثناء التدريب، مما يمنع الوكيل من استكشاف المناطق غير الآمنة من فضاء الحالة.
النتائج التجريبية
تم التقييم في بيئة NVIDIA Isaac Lab لمهام تتبع المسار، وتمت مقارنة CALOS بكل من PPO غير المقيد، وإسقاط الميل المستقل (PTP)، ومقياس ليابونوف المستقل، ونموذج متسلسل يجمع بينهما.
- أداء التتبع: قلل كل من CALOS-P و CALOS-QP خطأ التتبع الجانبي بنسبة 55–60% مقارنة بالأساس المرجعي PPO غير المقيد في مسارات التدريب. وفي المسارات غير المرئية ذات الإزاحات الأولية الكبيرة، حافظت متغيرات CALOS على أخطاء أقل من 0.08 م، بينما فشلت طرق ليابونوف والنموذج المتسلسل في التتبع بسبب إبطال عزم الدوران.
- مقاييس السلامة: حقق CALOS-QP صفر انتهاكات لقيود الوضعية في مسار التدريب. وتحت الإزاحات الأولية القصوى، اقتصرت الانتهاكات على 3 خطوات متتالية كحد أقصى (CALOS-P) أو 9 خطوات (CALOS-QP)، مقارنة بما يصل إلى 27 خطوة للأساليب المتسلسلة.
- التقارب وكفاءة البيانات: من خلال حصر الاستكشاف في المناطق الآمنة، سرّع CALOS من تقارب التدريب.
- السلوك الداخلي: احتفظت السياسات المدربة باستخدام CALOS بسلوك أكثر أماناً ودقة حتى عند تعطيل طبقة السلامة وقت الاختبار، حيث أظهرت خطأً جانبياً أقل بنسبة 55-74% من السياسات المدربة بـ PPO. يشير هذا إلى أن السياسة نجحت في استيعاب قيود السلامة داخلياً.
الأهمية
تزعم الورقة أن CALOS يحل المقايضة بين فرض السلامة وكفاءة التعلم. ومن خلال صياغة السلامة كمسألة برمجة تربيعية (QP) منخفضة الأبعاد، فإنه يضمن عدم تدهور إشارة التدرج بسبب التصحيحات المتسلسلة العدوانية. يسمح المنهج للسياسة بتعلم السلوكيات المثلى ضمن المنوع الآمن، مما ينتج سياسات أكثر أماناً وكفاءة في البيانات بطبيعتها دون التضحية بأداء التتبع. وتلاحظ الورقة أن مجموعة الجدوى لـ QP ظلت غير فارغة في جميع الاختبارات، مما يؤكد قوة الصياغة المشتركة.
العمل المستقبلي
حدد المؤلفون ثلاثة اتجاهات للبحث المستقبلي:
- تطوير شهادات ليابونوف متعلمة ومرتبطة بالمهمة لتجنب التدخلات غير الضرورية عندما تتبع الطائرة وضعية مرجعية غير صفرية ولكنها ممكنة.
- توسيع الإطار ليشمل الديناميكيات غير الأفينية للتحكم (مثل النماذج التي تتضمن ديناميكيات سرعة الدوار أو تأثيرات رفرفة الشفرات).
- استقصاء النقل من المحاكاة إلى الواقع (sim-to-real) باستخدام عشوائية النطاق والمرشحات القائمة على البيانات للتعامل مع عدم اليقين في النموذج على الأجهزة الفيزيائية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.