Deep Reinforcement Learning for Reach-Avoid-Stay Problems
تقترح هذه الورقة إطار عمل للتعلم التعزيزي العميق يتكون من خطوتين، حيث يتعلم بشكل مشترك مجموعة "الوصول-التجنب-البقاء" (Reach-Avoid-Stay) القصوى والمتينة وسياسة تحكم تبديلية مقابلة لها، مما يظهر دقة وأداءً فائقين في ضمان وصول الأنظمة بأمان وبقائها ضمن مجموعات مستهدفة تحت تأثير اضطرابات محدودة مقارنة بالطرق الحالية.
في عالم الروبوتات والآلات ذاتية القيادة، لا تقتصر السلامة على مجرد تجنب الاصطدام؛ بل تتعلق بمعرفة أين يمكن للآلة أن تذهب، والأهم من ذلك، أين يجب أن تتوقف. تخيل سيارة ذاتية القيادة أو طائرة بدون طيار للتوصيل تتنقل في مدينة مزدحمة. يستخدم المهندسون أدوات رياضية لرسم خرائط "المناطق الآمنة"، لضمان أنه إذا بدأت الآلة من نقطة معينة، فيمكنها الوصول إلى وجهتها دون الاصطدام بأي شيء. ومع ذلك، فإن هناك خللاً شائعاً في خرائط السلامة هذه، وهو أنها غالباً ما تخبر الآلة كيفية الوصول إلى الهدف، لكنها تفشل في إخبارها بكيفية البقاء فيه. فقد تصل المركبة إلى مكان وقوف السيارات، ولكن بسبب الرياح أو السرعة المفاجئة، قد تعجز عن التباطؤ بما يكفي للبقاء متوقفة، مما يؤدي إلى انزلاقها خارج المنطقة الآمنة والوقوع في خطر. لقد كانت هذه الفجوة بين الوصول والبقاء مشكلة طويلة الأمد لعلماء الكمبيوتر الذين يحاولون جعل الآلات موثوقة حقاً في البيئات غير المتوقعة.
ولحل هذه المشكلة، طور فريق من الباحثين في جامعة ولاية نورث كارولاينا وجامعة تكساس في أوستن طريقة جديدة لتعليم الآلات كيفية الوصول إلى هدف ما والحفاظ على موقعها ضد أي اضطراب. لقد ركزوا على تحدٍ محدد يسمى مشكلة "الوصول-التجنب-البقاء" (reach-avoid-stay). وببساء عبارة، يتساءل هذا التحدي: من أي نقاط بداية يمكن للآلة أن تصل بأمان إلى هدف ما، وتتجنب جميع العوائق، ثم تبقى داخل ذلك الهدف للأبد، حتى لو هبت الرياح أو أصبح الطريق زلقاً؟ كانت الطرق السابقة تواجه صعوبة في ذلك لأنها إما اعتمدت على تصميمات رياضية معقدة يصعب إنشاؤها للآلات المعقدة، أو أنها وضعت افتراضات غير واقعية، مثل افتراض أن المركبة يمكنها التوقف فوراً. اقترح الباحثون عملية تعلم من خطوتين باستخدام نوع من الذكاء الاصطناعي يُعرف بالتعلم التعزيزي العميق، حيث يتعلم الكمبيوتر من خلال التجربة والخطأ في عالم محاكى.
يعمل نهج الفريق مثل رحلة مكونة من مرحلتين. أولاً، يتعلم الكمبيوتر تحديد منطقة داخلية خاصة داخل منطقة الهدف. هذه المنطقة الداخلية هي مكان يمكن للآلة البقاء فيه بأمان للأبد، بغض النظر عن الاضطرابات التي تواجهها. ويطلق الباحثون على هذا الاسم "نواة الصلاحية القوية" (robust viability kernel). ولإيجاد ذلك، يتعلم الذكاء الاصطناعي "سياسة"، أو مجموعة من القواعد، تحافظ على حركة الآلة بطريقة لا تسمح لها أبداً بالانزلاق خارج هذه الدائرة الداخلية الآمنة. وبمجرد أن يتقن الكمبيوتر سلوك "البقاء" هذا، ينتقل إلى الخطوة الثانية. هنا، يتعلم كيفية نقل الآلة من أي نقطة بداية إلى تلك المنطقة الداخلية الآمنة بأسرع ما يمكن، مع تجنب جميع العوائق في الطريق. وقد أثبت الباحثون رياضياً أنه إذا استطاعت الآلة الوصول إلى هذه المنطقة الداخلية ثم البقاء فيها، فقد نجحت في إكمال المهمة بأكملها. ومن خلال دمج هذين السلوكين المتعلمين في نظام تبديل واحد، تعرف الآلة تماماً متى تقود نحو الهدف ومتى تنتقل إلى وضعية تحافظ على ثباتها في مكانها.
اختبر الباحثون هذه الطريقة في عدة سيناريوهات مختلفة، تتراوح من عربة بسيطة ثنائية الأبعاد على مسار إلى عمليات محاكاة معقدة وعالية الأبعاد لطائرة عمودية الإقلاع والهبوط (VTOL) تطير عبر مدينة، وحاصدة تقوم بتفريغ المحاصيل من حصادة متحركة. في حالة العربة البسيطة، قارنوا طريقتهم الجديدة بتقنية قديمة تستخدم دوال رياضية معقدة. حدد نهجهم الجديد منطقة بدء آمنة أكبر بنحو خمسة عشر ضعفاً من المنطقة التي وجدتها الطريقة القديمة، مما يعني أنها سمحت للآلة بالبدء من مواقع أكثر دون المخاطرة بالفشل. وفي عمليات المحاكاة الأكثر تعقيداً التي شملت الطائرة العمودية والحاصدة، حدد النهج الجديد مناطق البدء الآمنة بدقة تزيد عن 95 بالمائة، حتى عندما تضمنت عملية التعلم أخطاء صغيرة نموذجية لتدريب الكمبيوتر.
أظهرت النتائج فرقاً صارخاً بين الآلات التي تم تدريبها بالطرق القديمة وتلك التي تم تدريبها بهذا الإطار الجديد المكون من خطوتين. فعند اختبار الطائرة العمودية، فشلت طريقة "الوصول-والتجنب" القديمة، التي تهتم فقط بالوصول إلى الهدف، تماماً في مهمة البقاء هناك، محققة نسبة نجاح صفر بالمائ^ة. في المقابل، نجحت الطريقة الجديدة بنسبة 93 بالمائة. وبالمثل، في سيناريو الحاصدة، نجحت الطريقة الجديدة بنسبة 99.3 بالمائة، بينما نجحت الطريقة القديمة بنسبة 73.5 بالمائة فقط. ووجد الباحثون أن الطرق القديمة غالباً ما تقود الآلات إلى منطقة الهدف بالسرعة الكاملة، مما يتركها دون وسيلة للتباطؤ والبقاء في مكانها. ومع ذلك، تعلمت الطريقة الجديدة إبطاء سرعة الآلة مبكراً، مما يضمن دخولها إلى المنطقة الداخلية الآمة بسرعة تسمح لها بالبقاء فيها إلى أجل غير مسمى.
بينما كانت عمليات المحاكاة ناجحة للغاية، أشار الباحثون إلى أن نظامهم يعتمد على وجود فهم دقيق للبيئة وفيزياء الآلة قبل بدء التدريب. فإذا تصرف العالم الحقيقي بشكل مختلف عن نموذج الكمبيوتر - على سبيل المثال، إذا كانت الرياح أقوى مما هو متوقع أو كانت الأرض أكثر انزلاقاً - فقد لا تتمكن الآلة المدربة من ضمان السلامة. ويقترح الفريق أن العمل المستقبلي سيتعين عليه دمج بيانات الاستشعار من العالم الحقيقي للتعامل مع هذه المجاهيل. وفي الوقت الحالي، يقدم إطار التعلم هذا المكون من خطوتين خطوة كبيرة للأمام، حيث يوفر طريقة لتعليم الآلات ليس فقط كيفية الوصول، بل كيفية البقاء أيضاً، مما يحول الضمان النظري للسلامة إلى أداة عملية للتطبيقات المعقدة في العالم الحقيقي.
تتناول الورقة مشكلة الوصول-التجنب-البقاء (RAS) للأنظمة الديناميكية غير الخطية الخاضعة لاضطرابات معادية محدودة. وخلافًا لمشكلات "الوصول-التجنب" (RA) القياسية، التي تتطلب من النظام الوصول إلى مجموعة هدف T مع تجنب المناطق غير الآمنة، فإن مشكلة RAS تفرض على النظام ليس فقط الوصول إلى T بل وأيضًا البقاء داخلها إلى أجل غير مسمى رغم وجود جميع الاضطرابات المحدودة.
تتمثل التحديات الجوهرية المحددة في أن أساليب RA الحالية غالبًا ما تفشل في التمييز بين مجموعة الهدف T ونواة الصلاحية القوية (أكبر مجموعة فرعية قوية ثابتة تحكميًا داخل T). فإذا وصل النظام إلى T ولكن لم يصل إلى نواة الصلاحية (على سبيل المثال، الدخول بسرعة مفرطة)، فقد لا يتمكن من البقاء داخل T تحت تأثير الاضطراب، مما يؤدي إلى انتهاكات السلامة. تواجه الأساليب الحالية لـ RAS قيودًا كبيرة:
طرق دالة ليابونوف-الحاجز للتحكم (CLBF) يصعب تصميمها للأنظمة عالية الأبعاد أو غير الخطية.
تعتمد الأساليب القائمة على القمع (Funnel-based methods) على افتراض مقيد وهو قدرة الأنظمة على التوقف الفوري.
غالبًا ما تفشل أساليب التعلم التعزيزي (RL) الحالية في تحديد أكبر مجموعة RAS قوية، مما يؤدي إلى سياسات متحفظة أو تصنيفات سلامة غير دقيقة.
الهدف هو حساب أكبر مجموعة RAS قوية (مجموعة جميع الحالات الأولية التي يمكن من خلالها تحقيق مهمة RAS) وسياسة تحكم مقابلة تضمن إتمام المهمة تحت جميع الاضطرابات المحدودة.
المنهجية
يقترح المؤلفون إطار عمل للتعلم التعزيزي العميق (RL) يتكون من خطوتين يتعلم من خلالهما بشكل مشترك أكبر مجموعة RAS قوية ومجموعة السياسة المرتبطة بها. يستخدم إطار العمل خوارزمية "تدرج السياسة الحتمية العميقة" (DDPG) للأنظمة عالية الأبعاد.
الخطوة 1: حساب نواة الصلاحية القوية (AS)
تحدد الخطوة الأولى نواة الصلاحية القوية AS داخل مجموعة الهدف T. وهي المجموعة التي يمكن للنظام من خلالها البقاء في T∩C (مجموعتي الهدف والقيود) إلى أجل غير مسمى.
يتم تعريف دالة قيمة مخفضة H(x) لتوصيف AS.
H(x) هي الحل الفريد لمعادلة بلمان (Bellman equation) تتضمن عامل (min-max) فوق سياسات التحكم والاضطراب.
تتوافق المجموعة AS مع مستوى الصفر لدالة H (حيث H(x)=0).
يتم اشتقاق سياسة πH لإبقاء النظام داخل AS بمجرد دخوله.
الخطوة 2: حساب أكبر مجموعة RAS قوية
تتعامل الخطوة الثانية مع مشكلة RAS كمسألة وصول-تجنب (RA) حيث يكون الهدف هو نواة الصلاحية القوية AS بدلاً من المجموعة الأصلية T.
تحويل دالة القيمة: نظرًا لأن H(x) تساوي صفرًا عند AS، فلا يمكن استخدامها كعائد للوصول إلى AS (لأنها لا توفر حافزًا للوصول إلى المجموعة بسرعة). يقدم المؤلفون دالة قيمة محولة Hg(x):
Hg(x)=H(x) إذا كان H(x)<0 (خارج AS).
Hg(x)=g(x) (قيمة موجبة) إذا كان x∈AS.
يضمن هذا أن تكون Hg موجبة تمامًا داخل AS وغير موجبة في مكان آخر.
صياغة RA: يتم تعريف دالة قيمة جديدة V(x) باستخدام Hg كعائد مستهدف. تمثل V(x) أكبر مجموعة RAS قوية.
سياسة التبديل: يتم بناء سياسة موحدة πRAS عن طريق التبديل بين سياسة "الوصول" (πV) وسياسة "البقاء" (πH):
استخدام πV عندما تكون Hg(x)≤0 (خارج AS) لدفع النظام نحو AS.
التبديل إلى πH عندما تكون Hg(x)>0 (داخل AS) لضمان السلامة إلى أجل غير مسمى.
المساهمات الرئيسية
الإثبات النظري للتعظيم: يثبت المؤلفون أنه في حالة عدم وجود أخطاء تدريب، فإن إطار عملهم يحدد أكبر مجموعة RAS قوية بدقة. كما يوضحون أن سياسة التبديل الناتجة تضمن مهمة RAS لجميع الحالات في هذه المجموعة تحت جميع الاضطرابات المحدودة. ويتحقق ذلك عبر تحويل دالة القيمة المقترح (Hg)، والذي يسمح بدمج تحليل نواة الصلاحية مع أساليب الوصول-التجنب (RA).
التعلم عالي الدقة باستخدام التعلم التعزيزي العميق: تم تكييف إطار العمل للأنظمة عالية الأبعاد باستخدام DDPG. ويظهر المؤلفون أنه حتى مع أخطاء التدريب المتأصلة في الشبكات العصبية، فإن إطار العمل يميز أكبر مجموعة RAS قوية بدقة عالية (>95%).
القابلية للتطبيق العملي: يتعامل الأسلوب مع البيئات المعقدة حيث يكون تصميم CLBF غير قابل للتنفيذ، ولا يعتمد على افتراض "التوقف الفوري" المطلوب في الأساليب القائمة على القمع.
التحقق التجريبي: تثبت المحاكاة على أنظمة منخفضة الأبعاد (Double Integrator) وعالية الأبعاد (VTOL Taxi, Nonlinear Harvester) صحة النهج.
النتائج
تحديد أكبر مجموعة: في مثال Double Integrator ثنائي الأبعاد، حدد الإطار المقترح مجموعة RAS بحجم 28.67، وهو أكبر بكثير من حجم 1.98 الذي حدده نموذج CLBF المرجعي. يشير هذا إلى أن الطريقة المقترحة أقل تحفظًا وتحدد حالات أكثر قابلية للتنفيذ.
الدقة: في التجارب عالية الأبعاد (VTOL و Harvester)، حقق إطار العمل دقة بلغت 95.8% و 99.4% على التوالي، في تحديد مجموعة RAS مقارنة بالحقيقة الأرضية (ground truth) الناتجة عن السياسة نفسها.
معدلات نجاح المهمة: تفوقت سياسة RAS المقترحة بشكل كبير على طريقة RA المرجعية في إكمال مهمة RAS:
VTOL: معدل نجاح 93.0% (RAS) مقابل 0% (الأساس RA).
Harvester: معدل نجاح 99.3% (RAS) مقابل 73.5% (الأساس RA).
تحليل الفشل: توضح الورقة أن سياسات RA تفشل في مهمة RAS لأنها تصل إلى مجموعة الهدف T بسرعات عالية دون الدخول إلى نواة الصلاحية AS. وبناءً على ذلك، لا يمكنها الحفاظ على الحالة داخل T تحت تأثير الاضطراب. بينما تقوم سياسة RAS بإبطاء النظام بشكل صحيح قبل دخول T لضمان هبوطه داخل AS.
الأهمية والادعاءات
تدعي الورقة أن أهميتها الرئيسية تكمن في توفير إطار عمل قائم على البيانات وذو أسس نظرية يحل مشكلة RAS للأنظمة غير الخطية العامة دون افتراضات مقيدة.
فهي تسد الفجوة بين تحليل الوصول (reachability analysis) والتعلم التعزيزي العميق، وتثبت أن نهج الخطوتين ينتج أكبر مجموعة قوية.
تعالج مشكلة "السالب الحقيقي" (false negative) في الأساليب المتحفظة (مثل CLBF) ومشكلة "الموجب الكاذب" (false positive) في مخاطر السلامة لأساليب RA القياسية.
يقر المؤلفون بأن إطار العمل يعتمد على المعرفة المسبقة بديناميكيات النظام وقيود البيئة. ويشيرون إلى أنه بينما يفتقر التعلم التعزيزي الحالي الموجه نحو السلامة غالبًا إلى الضمانات النظرية الصارمة، فإن هذا العمل يوفر مثل هذه التأكيدات لمشكلة RAS، بشرط دقة النموذج. ويُقترح كعمل مستقبلي دمج بيانات الاستشعار من العالم الحقيقي والتعامل مع معلومات البيئة غير المعروفة.