← أحدث الأبحاث
💻 computer science

Safe Learning Predictive Control for Ego-World Robotic Systems

تقدم هذه الورقة البحثية SOWL-MPC، وهو إطار عمل للتحكم التنبؤي القائم على التعلم الآمن يُمكّن روبوتًا ذاتيًا من التنقل في بيئات مشتركة مع روبوتات عالمية غير معروفة من خلال الجمع بين تعلم العمليات الغاوسية المتغيرة المتفرقة عبر الإنترنت والتحكم التنبؤي المعتمد على الوعي بعدم اليقين.

المؤلفون الأصليون: Davide Valenti, Giuseppe Notarstefano

نُشر 2026-07-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Davide Valenti, Giuseppe Notarstefano

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تلعب لعبة "الغميضة" (tag) عالية المخاطر في ممر مزدحم وفوضوي. أنت اللاعب "الأنا" (Ego)، وهدفك هو الركض في مسار محدد دون الاصطدام بأي شخص. لكن هنا تكمن الخدعة: اللاعبون الآخرون، "روبوتات العالم" (World)، يتحركون من حولك، وليس لديك أدنى فكرة عن خطتهم للعب. هل سيتوقفون؟ هل سينعطفون يساراً؟ هل سيزيدون من سرعتهم؟ في عالم الروبوتات، هذا هو التحدي الأسمى: كيف تقود سيارة أو روبوتاً بأمان عندما يمكن للسائقين الآخرين فعل أي شيء، ولا يمكنك قراءة عقولهم؟

لحل هذه المشكلة، يعتمد العلماء عادةً على شيئين. أولاً، يستخدمون التحكم التنبئي بالنموذج (MPC)، وهو يشبه نظام GPS فائق الذكاء لا ينظر فقط إلى مكانك الآن، بل يحاكي الثواني القليلة القادمة من رحلتك ليرى ما إذا كنت ستصطدم أم لا. ثانياً، يستخدمون تعلم الآلة، وتحديداً أداة تسمى عمليات غاوس (Gaussian Processes)، والتي تعمل كبلورة كريستالية إحصائية. بدلاً من التخمين، تنظر هذه البلورة إلى البيانات الماضية للتنبؤ بالمستقبل، ولكن الأهم من ذلك أنها تخبرك أيضاً بمدى "عدم تأكدها". إذا كانت البلورة تهتز، فإن الروبوت يعرف أنه يجب أن يكون حذراً للغاية. السؤال الكبير الذي يتناوله هذا البحث هو: هل يمكننا تعليم الروبوت تعلم "شخصية" روبوت غريب بشكل فوري، وتحديث بلورته الكريستالية في الوقت الفعلي، واستخدام ذلك لتفادي الاصطدامات بأمان، حتى عندما يفعل الغريب شيئاً غير متوقع تماماً؟

يقدم هذا البحث استراتيجية جديدة تسمى SOWL-MPC (التحكم التنبئي بالنموذج لتعلم سياسة العالم عبر الإنترنت بشكل آمن). فكر في الأمر كمنح الروبوت الخاص بك "قوة خارقة" لتعلم عادات الغريب فوراً. في سيناريو "الأنا-العالم" الذي وضعه المؤلفون، لا يعرف الروبوت الذي تتحكم به (الأنا) القواعد التي يتبعها الروبوت الآخر (العالم). قد يتبع الروبوت الآخر نصاً مخفياً، أو قد يغير رأيه في كل ثانية. تحاول الطرق التقليدية تخمين مسار الروبوت الآخر باستخدام قواعد ثابتة أو ذاكرة مدربة مسبقاً، ولكن إذا فعل الروبوت الآخر شيئاً جديداً، فإن تلك الطرق تفشل أو تصبح خائفة جداً من الحركة.

يغير SOWL-MPC قواعد اللعبة من خلال العمل كالمحقق الذي يتعلم أثناء السير. فبدلاً من مجرد مراقبة الروبوت الآخر، يستخدم خدعة رياضية خاصة تسمى عمليات غاوس المتغيرة المتفرقة (SVGP) لبناء نموذج لـ "دماغ" (سياسة التحكم) الروبوت الآخر أثناء مراقبته وهو يتحرك. يظهر البحث أن الروبوت يمكنه أخذ ملاحظات ضوضائية وضبابية لموقع الروبوت الآخر واستنتاج الأوامر التي يرسلها الروبوت الآخر لعجلاته على الأرجح. يفعل ذلك باستخدام تقنية تسمى التكييف المتغير عبر الإنترنت (OVC)، وهي تشبه تحديث خريطة في الوقت الفعلي دون الحاجة إلى إعادة رسم الخريطة بالكامل في كل مرة ترى فيها شارعاً جديداً.

اختبر المؤلفون ذلك بطريقتين. أولاً، أجروا آلاف المحاكاة في عالم افتراضي باستخدام سيارات NVIDIA JetRacer في مضمار سباق. ووجدوا أنه عندما بدأت سيارة "العالم" بالقيادة في جزء جديد وغير مستكشف من المضمار، تعلمت SOWL-MPC سلوكها الجديد بسرعة. وبينما استمر الروبوت القياسي الذي لا يمكنه التعلم عبر الإنترنت في الاصطدام أو تفويت الهدف، تكيفت SOWL-MPC، حيث قللت أخطاء التنبؤ من أخطاء فادحة إلى خطأ ضئيل قدره 0.05 متر (حوالي بوصتين) بعد لفة واحدة فقط. كما اختبروا مدى "أمان" الروبوت عن طريق تغيير مقبض الأمان المسمى nσn_\sigma. فعندما رفعوا مستوى الأمان إلى 3، أصبح الروبوت حذراً للغاية، حيث خطط مسبقاً لتجنب أي احتمال للاصطدام، محققاً نسبة نجاح 100% في تجنب الاصطدامات عبر 50 تجربة عشوائية مختلفة.

أخيراً، لم يكتف الفريق بمجرد عمليات المحاكاة الحاسوبية. لقد أخذوا الكود ووضعوه على روبوتات حقيقية مادية في ساحة داخلية. وراقبوا روبوت "الأنا" وهو ينجح في تفادي روبوت "العالم" الذي كان يقطع طريقه أو يتجاوزه. أكدت الاختبارات في العالم الحقيقي ما اقترحته عمليات المحاكاة: يمكن للروبوت تعلم سلوك الروبوت الآخر على الطاير والتحرك بأمان. يخلص البحث إلى أن هذا النهج فعال، مما يثبت أن الروبوت يمكن أن يكون متعلمًا سريعًا وسائقًا آمنًا في آن واحد، حتى عندما يكون السائق الآخر لغزاً. إنه ليس عصا سحرية تحل كل مشكلات الكون، ولكن بالنسبة للتحدي المحدد المتمثل في وجود روبوتين يتشاركان مساحة يكون فيها أحدهما مجهولاً، فإن SOWL-MPC يظهر مساراً واعداً للغاية للمستقبل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →