← أحدث الأبحاث
⚡ electrical engineering

Deep Reinforcement Learning for Reach-Avoid-Stay Problems

تقترح هذه الورقة إطار عمل للتعلم التعزيزي العميق يتكون من خطوتين، حيث يتعلم بشكل مشترك مجموعة "الوصول-التجنب-البقاء" (Reach-Avoid-Stay) القصوى والمتينة وسياسة تحكم تبديلية مقابلة لها، مما يظهر دقة وأداءً فائقين في ضمان وصول الأنظمة بأمان وبقائها ضمن مجموعات مستهدفة تحت تأثير اضطرابات محدودة مقارنة بالطرق الحالية.

المؤلفون الأصليون: Gabriel Chenevert, Jingqi Li, Achyuta kannan, Sangjae Bae, Donggun Lee

نُشر 2026-09-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Gabriel Chenevert, Jingqi Li, Achyuta kannan, Sangjae Bae, Donggun Lee

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الروبوتات والآلات ذاتية القيادة، لا تقتصر السلامة على مجرد تجنب الاصطدام؛ بل تتعلق بمعرفة أين يمكن للآلة أن تذهب، والأهم من ذلك، أين يجب أن تتوقف. تخيل سيارة ذاتية القيادة أو طائرة بدون طيار للتوصيل تتنقل في مدينة مزدحمة. يستخدم المهندسون أدوات رياضية لرسم خرائط "المناطق الآمنة"، لضمان أنه إذا بدأت الآلة من نقطة معينة، فيمكنها الوصول إلى وجهتها دون الاصطدام بأي شيء. ومع ذلك، فإن هناك خللاً شائعاً في خرائط السلامة هذه، وهو أنها غالباً ما تخبر الآلة كيفية الوصول إلى الهدف، لكنها تفشل في إخبارها بكيفية البقاء فيه. فقد تصل المركبة إلى مكان وقوف السيارات، ولكن بسبب الرياح أو السرعة المفاجئة، قد تعجز عن التباطؤ بما يكفي للبقاء متوقفة، مما يؤدي إلى انزلاقها خارج المنطقة الآمنة والوقوع في خطر. لقد كانت هذه الفجوة بين الوصول والبقاء مشكلة طويلة الأمد لعلماء الكمبيوتر الذين يحاولون جعل الآلات موثوقة حقاً في البيئات غير المتوقعة.

ولحل هذه المشكلة، طور فريق من الباحثين في جامعة ولاية نورث كارولاينا وجامعة تكساس في أوستن طريقة جديدة لتعليم الآلات كيفية الوصول إلى هدف ما والحفاظ على موقعها ضد أي اضطراب. لقد ركزوا على تحدٍ محدد يسمى مشكلة "الوصول-التجنب-البقاء" (reach-avoid-stay). وببساء عبارة، يتساءل هذا التحدي: من أي نقاط بداية يمكن للآلة أن تصل بأمان إلى هدف ما، وتتجنب جميع العوائق، ثم تبقى داخل ذلك الهدف للأبد، حتى لو هبت الرياح أو أصبح الطريق زلقاً؟ كانت الطرق السابقة تواجه صعوبة في ذلك لأنها إما اعتمدت على تصميمات رياضية معقدة يصعب إنشاؤها للآلات المعقدة، أو أنها وضعت افتراضات غير واقعية، مثل افتراض أن المركبة يمكنها التوقف فوراً. اقترح الباحثون عملية تعلم من خطوتين باستخدام نوع من الذكاء الاصطناعي يُعرف بالتعلم التعزيزي العميق، حيث يتعلم الكمبيوتر من خلال التجربة والخطأ في عالم محاكى.

يعمل نهج الفريق مثل رحلة مكونة من مرحلتين. أولاً، يتعلم الكمبيوتر تحديد منطقة داخلية خاصة داخل منطقة الهدف. هذه المنطقة الداخلية هي مكان يمكن للآلة البقاء فيه بأمان للأبد، بغض النظر عن الاضطرابات التي تواجهها. ويطلق الباحثون على هذا الاسم "نواة الصلاحية القوية" (robust viability kernel). ولإيجاد ذلك، يتعلم الذكاء الاصطناعي "سياسة"، أو مجموعة من القواعد، تحافظ على حركة الآلة بطريقة لا تسمح لها أبداً بالانزلاق خارج هذه الدائرة الداخلية الآمنة. وبمجرد أن يتقن الكمبيوتر سلوك "البقاء" هذا، ينتقل إلى الخطوة الثانية. هنا، يتعلم كيفية نقل الآلة من أي نقطة بداية إلى تلك المنطقة الداخلية الآمنة بأسرع ما يمكن، مع تجنب جميع العوائق في الطريق. وقد أثبت الباحثون رياضياً أنه إذا استطاعت الآلة الوصول إلى هذه المنطقة الداخلية ثم البقاء فيها، فقد نجحت في إكمال المهمة بأكملها. ومن خلال دمج هذين السلوكين المتعلمين في نظام تبديل واحد، تعرف الآلة تماماً متى تقود نحو الهدف ومتى تنتقل إلى وضعية تحافظ على ثباتها في مكانها.

اختبر الباحثون هذه الطريقة في عدة سيناريوهات مختلفة، تتراوح من عربة بسيطة ثنائية الأبعاد على مسار إلى عمليات محاكاة معقدة وعالية الأبعاد لطائرة عمودية الإقلاع والهبوط (VTOL) تطير عبر مدينة، وحاصدة تقوم بتفريغ المحاصيل من حصادة متحركة. في حالة العربة البسيطة، قارنوا طريقتهم الجديدة بتقنية قديمة تستخدم دوال رياضية معقدة. حدد نهجهم الجديد منطقة بدء آمنة أكبر بنحو خمسة عشر ضعفاً من المنطقة التي وجدتها الطريقة القديمة، مما يعني أنها سمحت للآلة بالبدء من مواقع أكثر دون المخاطرة بالفشل. وفي عمليات المحاكاة الأكثر تعقيداً التي شملت الطائرة العمودية والحاصدة، حدد النهج الجديد مناطق البدء الآمنة بدقة تزيد عن 95 بالمائة، حتى عندما تضمنت عملية التعلم أخطاء صغيرة نموذجية لتدريب الكمبيوتر.

أظهرت النتائج فرقاً صارخاً بين الآلات التي تم تدريبها بالطرق القديمة وتلك التي تم تدريبها بهذا الإطار الجديد المكون من خطوتين. فعند اختبار الطائرة العمودية، فشلت طريقة "الوصول-والتجنب" القديمة، التي تهتم فقط بالوصول إلى الهدف، تماماً في مهمة البقاء هناك، محققة نسبة نجاح صفر بالمائ^ة. في المقابل، نجحت الطريقة الجديدة بنسبة 93 بالمائة. وبالمثل، في سيناريو الحاصدة، نجحت الطريقة الجديدة بنسبة 99.3 بالمائة، بينما نجحت الطريقة القديمة بنسبة 73.5 بالمائة فقط. ووجد الباحثون أن الطرق القديمة غالباً ما تقود الآلات إلى منطقة الهدف بالسرعة الكاملة، مما يتركها دون وسيلة للتباطؤ والبقاء في مكانها. ومع ذلك، تعلمت الطريقة الجديدة إبطاء سرعة الآلة مبكراً، مما يضمن دخولها إلى المنطقة الداخلية الآمة بسرعة تسمح لها بالبقاء فيها إلى أجل غير مسمى.

بينما كانت عمليات المحاكاة ناجحة للغاية، أشار الباحثون إلى أن نظامهم يعتمد على وجود فهم دقيق للبيئة وفيزياء الآلة قبل بدء التدريب. فإذا تصرف العالم الحقيقي بشكل مختلف عن نموذج الكمبيوتر - على سبيل المثال، إذا كانت الرياح أقوى مما هو متوقع أو كانت الأرض أكثر انزلاقاً - فقد لا تتمكن الآلة المدربة من ضمان السلامة. ويقترح الفريق أن العمل المستقبلي سيتعين عليه دمج بيانات الاستشعار من العالم الحقيقي للتعامل مع هذه المجاهيل. وفي الوقت الحالي، يقدم إطار التعلم هذا المكون من خطوتين خطوة كبيرة للأمام، حيث يوفر طريقة لتعليم الآلات ليس فقط كيفية الوصول، بل كيفية البقاء أيضاً، مما يحول الضمان النظري للسلامة إلى أداة عملية للتطبيقات المعقدة في العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →