Safe Learning Predictive Control for Ego-World Robotic Systems
تقدم هذه الورقة البحثية SOWL-MPC، وهو إطار عمل للتحكم التنبؤي القائم على التعلم الآمن يُمكّن روبوتًا ذاتيًا من التنقل في بيئات مشتركة مع روبوتات عالمية غير معروفة من خلال الجمع بين تعلم العمليات الغاوسية المتغيرة المتفرقة عبر الإنترنت والتحكم التنبؤي المعتمد على الوعي بعدم اليقين.
المؤلفون الأصليون:Davide Valenti, Giuseppe Notarstefano
تخيل أنك تلعب لعبة "الغميضة" (tag) عالية المخاطر في ممر مزدحم وفوضوي. أنت اللاعب "الأنا" (Ego)، وهدفك هو الركض في مسار محدد دون الاصطدام بأي شخص. لكن هنا تكمن الخدعة: اللاعبون الآخرون، "روبوتات العالم" (World)، يتحركون من حولك، وليس لديك أدنى فكرة عن خطتهم للعب. هل سيتوقفون؟ هل سينعطفون يساراً؟ هل سيزيدون من سرعتهم؟ في عالم الروبوتات، هذا هو التحدي الأسمى: كيف تقود سيارة أو روبوتاً بأمان عندما يمكن للسائقين الآخرين فعل أي شيء، ولا يمكنك قراءة عقولهم؟
لحل هذه المشكلة، يعتمد العلماء عادةً على شيئين. أولاً، يستخدمون التحكم التنبئي بالنموذج (MPC)، وهو يشبه نظام GPS فائق الذكاء لا ينظر فقط إلى مكانك الآن، بل يحاكي الثواني القليلة القادمة من رحلتك ليرى ما إذا كنت ستصطدم أم لا. ثانياً، يستخدمون تعلم الآلة، وتحديداً أداة تسمى عمليات غاوس (Gaussian Processes)، والتي تعمل كبلورة كريستالية إحصائية. بدلاً من التخمين، تنظر هذه البلورة إلى البيانات الماضية للتنبؤ بالمستقبل، ولكن الأهم من ذلك أنها تخبرك أيضاً بمدى "عدم تأكدها". إذا كانت البلورة تهتز، فإن الروبوت يعرف أنه يجب أن يكون حذراً للغاية. السؤال الكبير الذي يتناوله هذا البحث هو: هل يمكننا تعليم الروبوت تعلم "شخصية" روبوت غريب بشكل فوري، وتحديث بلورته الكريستالية في الوقت الفعلي، واستخدام ذلك لتفادي الاصطدامات بأمان، حتى عندما يفعل الغريب شيئاً غير متوقع تماماً؟
يقدم هذا البحث استراتيجية جديدة تسمى SOWL-MPC (التحكم التنبئي بالنموذج لتعلم سياسة العالم عبر الإنترنت بشكل آمن). فكر في الأمر كمنح الروبوت الخاص بك "قوة خارقة" لتعلم عادات الغريب فوراً. في سيناريو "الأنا-العالم" الذي وضعه المؤلفون، لا يعرف الروبوت الذي تتحكم به (الأنا) القواعد التي يتبعها الروبوت الآخر (العالم). قد يتبع الروبوت الآخر نصاً مخفياً، أو قد يغير رأيه في كل ثانية. تحاول الطرق التقليدية تخمين مسار الروبوت الآخر باستخدام قواعد ثابتة أو ذاكرة مدربة مسبقاً، ولكن إذا فعل الروبوت الآخر شيئاً جديداً، فإن تلك الطرق تفشل أو تصبح خائفة جداً من الحركة.
يغير SOWL-MPC قواعد اللعبة من خلال العمل كالمحقق الذي يتعلم أثناء السير. فبدلاً من مجرد مراقبة الروبوت الآخر، يستخدم خدعة رياضية خاصة تسمى عمليات غاوس المتغيرة المتفرقة (SVGP) لبناء نموذج لـ "دماغ" (سياسة التحكم) الروبوت الآخر أثناء مراقبته وهو يتحرك. يظهر البحث أن الروبوت يمكنه أخذ ملاحظات ضوضائية وضبابية لموقع الروبوت الآخر واستنتاج الأوامر التي يرسلها الروبوت الآخر لعجلاته على الأرجح. يفعل ذلك باستخدام تقنية تسمى التكييف المتغير عبر الإنترنت (OVC)، وهي تشبه تحديث خريطة في الوقت الفعلي دون الحاجة إلى إعادة رسم الخريطة بالكامل في كل مرة ترى فيها شارعاً جديداً.
اختبر المؤلفون ذلك بطريقتين. أولاً، أجروا آلاف المحاكاة في عالم افتراضي باستخدام سيارات NVIDIA JetRacer في مضمار سباق. ووجدوا أنه عندما بدأت سيارة "العالم" بالقيادة في جزء جديد وغير مستكشف من المضمار، تعلمت SOWL-MPC سلوكها الجديد بسرعة. وبينما استمر الروبوت القياسي الذي لا يمكنه التعلم عبر الإنترنت في الاصطدام أو تفويت الهدف، تكيفت SOWL-MPC، حيث قللت أخطاء التنبؤ من أخطاء فادحة إلى خطأ ضئيل قدره 0.05 متر (حوالي بوصتين) بعد لفة واحدة فقط. كما اختبروا مدى "أمان" الروبوت عن طريق تغيير مقبض الأمان المسمى nσ. فعندما رفعوا مستوى الأمان إلى 3، أصبح الروبوت حذراً للغاية، حيث خطط مسبقاً لتجنب أي احتمال للاصطدام، محققاً نسبة نجاح 100% في تجنب الاصطدامات عبر 50 تجربة عشوائية مختلفة.
أخيراً، لم يكتف الفريق بمجرد عمليات المحاكاة الحاسوبية. لقد أخذوا الكود ووضعوه على روبوتات حقيقية مادية في ساحة داخلية. وراقبوا روبوت "الأنا" وهو ينجح في تفادي روبوت "العالم" الذي كان يقطع طريقه أو يتجاوزه. أكدت الاختبارات في العالم الحقيقي ما اقترحته عمليات المحاكاة: يمكن للروبوت تعلم سلوك الروبوت الآخر على الطاير والتحرك بأمان. يخلص البحث إلى أن هذا النهج فعال، مما يثبت أن الروبوت يمكن أن يكون متعلمًا سريعًا وسائقًا آمنًا في آن واحد، حتى عندما يكون السائق الآخر لغزاً. إنه ليس عصا سحرية تحل كل مشكلات الكون، ولكن بالنسبة للتحدي المحدد المتمثل في وجود روبوتين يتشاركان مساحة يكون فيها أحدهما مجهولاً، فإن SOWL-MPC يظهر مساراً واعداً للغاية للمستقبل.
ملخص تقني: نموذج التحكم التنبئي بالنماذج لتعلم سياسة العالم عبر الإنترنت الآمن (SOWL-MPC)
بيان المشكلة تتناول الورقة البحثية تحدي الملاحة الذاتية الآمنة لروبوت "أنا" (ego) يعمل في بيئة مشتركة مع روبوت "عالم" (world) الذي تكون سياسة التحكم الخاصة به غير معروفة وقد تكون غير مستقرة (non-stationary). يفترض سيناريو إطار عمل EGO–WORLD أن روبوت "أنا" لا يمتلك سوى قياسات حالة مشوشة لروبوت "العالم" (z~t=zt+wt) ومعرفة مسبقة بالديناميكيات الاسمية لروبوت "العالم" (متجه الانجراف g(z) ومصفوفة التحكم H(z))، ولكنه يفتقر إلى المعرفة بسياسة التحكم الفعلية لروبوت "العالم" π(z). غالبًا ما تكون الطرق التفاعلية التقليدية (مثل طريقة النافذة الديناميكية أو دالات حاجز التحكم) قاصرة عن الرؤية بعيدة المدى، بينما تعتمد النهج التنبؤية الحالية عادةً على نماذج مدربة مسبقاً (offline) أو افتراضات حركة ثابتة تفشل في التكيف مع السلوكيات غير المرئية. تكمن المشكلة الجوهرية في تصميم إطار تحكم عبر الإنترنت يمكنه تعلم سياسة "العالم" الكامنة بشكل تكراري من البيانات المتدفقة، واستخدام هذا التعلم لأداء مناورات آمنة وخالية من الاصطدام عبر التحكم التنبئي بالنماذج (MPC).
المنهجية يدمج الحل المقترح، SOWL-MPC، التعلم عبر الإنترنت مع مخطط تحكم ذي أفق متراجع من خلال ثلاث مراحل رئيسية:
نمذجة السياسة والتدريب المسبق خارج الإنترنت (Offline Pretraining): يتم نمذجة سياسة "العالم" المجهولة π(z) كمجموعة من العمليات الغاوسية المتغيرة المتفرقة (SVGPs) المستقلة، بواقع عملية واحدة لكل مكون من مكون متجه السياسة. في البداية، يتم اختيار المعلمات الفائقة (hyperparameters) عبر التدريب المسبق خارج الإنترنت على مجموعة بيانات من أزواج الحالة-المدخلات المشوشة. يتم إعادة بناء بيانات المدخلات (مدخلات تحكم العالم) عبر الإنترنت من ملاحظات الحالة المشوشة المتتالية باستخدام طريقة المربعات الصغرى بناءً على الديناميكيات الاسمية المعروفة.
التعلم عبر الإنترنت عبر التكييف المتغير عبر الإنترنت (OVC): للتكيف مع البيانات الجديدة في الوقت الفعلي دون التكلفة الحسابية الباهظة لإعادة التدريب، يستخدم المؤلفون التكييف المتغير عبر الإنترنت (OVC). بدلاً من تخزين التاريخ الكامل للبيانات، يحافظ OVC على إحصائيات كافية (مواقع التحريض، المتوسطات المتغيرة، والتباينات) لتحديث معلمات SVGP بشكل تكراري. تقوم الخوارزمية بإسقاط التوزيع اللاحق الحالي إلى "بيانات وهمية"، ودمجها مع الملاحظة الجديدة، وتحديث نقاط التحريض والمعلمات المتغيرة. يسمح هذا للنظام بتعلم السياسة الكامنة مباشرة من القياسات المشوشة المتدفقة.
التنبؤ بالمسار والتحكم الواعي باليقين: يتم نشر السياسة المتعلمة عبر ديناميكيات "العالم" غير الخطية باستخدام مخطط انتشار العزم الغاوسي من الدرجة الأولى (على غرار خطوة التنبؤ في مرشح كالمان الموسع). يولد هذا تنبؤاً احتماليًا متعدد الخطوات لمسار روبوت "العالم" المستقبلي، بما في ذلك مقياس لليقين التنبئي. تُغذى هذه التنبؤات في متحكم MPC غير خطي. يتضمن صياغة MPC ما يلي:
دالة التكلفة: تكلفة تتبع قياسية مع عقوبات على جهد التحكم ونعومة المدخلات.
قيود السلامة: يتم فرض تجنب الاصطدام عن طريق تضخيم مسافة الأمان بين الروبوتات. يتم تعديل هامش الأمان ديناميكيًا بناءً على اليقين التنبئي (أثر مصفوفة التباين) والمضروب في معامل سلامة محدد من قبل المستخدم nσ. تُطبق القيود الصارمة على الخطوة التالية المباشرة، بينما تسم تسمح متغيرات الإغاثة (slack variables) بالتخفيف المؤقت في أفق التنبؤ اللاحق لضمان القابلية للتنفيذ.
المساهمات الرئيسية تحدد الورقة ثلاث مساهمات رئيسية:
إطار عمل SOWL-MPC: استراتيجية تحكم مبتكرة لأنظمة EGO–WORLD تتعلم سياسة التغذية الراجعة للحالة الكامنة لروبوت عالم غير متعاون عبر الإنترنت، بدلاً من تعلم ديناميكيات النظام أو الاعتماد على متنبئات جاهزة. يستفيد هذا الصياغة من انخفاض أبعاد فضاء المدخلات مقارنة بفضاء الحالة لتحقيق كفاءة البيانات.
تطبيق OVC في الروبوتات: أول تطبيق للتكييف المتغير عبر الإنترنت (OVC) لتحديد السياسة عبر الإنترنت والتنبؤ بالمسار في الأنظمة الروبوتية. يتيح هذا للنماذج (SVGP) التحديث المستمر على البيانات المتدفقة بتعقيد حسابي ثابت (O(M3) لكل تحديث، حيث M هو عدد نقاط التحريض).
التحقق في الوقت الفعلي: تنفيذ كامل في ROS 2 (متكامل مع صندوق أدوات CHOIRBOT) يثبت الجدوى في الوقت الفعلي. تم التحقق من النهج من خلال تجارب افتراضية موسعة بطريقة مونت كارلو واختبارات أجهزة حقيقية تتضمن مناورات التجاوز والعبور.
النتائج التجريبية تم تقييم الاستراتيجية في كل من البيئات الافتراضية (Webots/ROS 2) والبيئات الواقعية (ساحة داخلية مع سيارات NVIDIA JetRacer):
دقة التنبؤ: في التجارب الافتراضية على مسارات ETHZ MOBIL و LEMNISCATE، تفوق SOWL-MPC بشكل كبير على نموذج GP الأساسي المدرب مسبقاً (offline) ونموذج السرعة الثابتة (CV). استقر متوسط خطأ الإزاحة (ADE) لـ SOWL-MPC عند حوالي 0.05 م بعد مرحلة التعلم الأولية، مقارنة بأخطاء تتجاوز 0.4 م لنموذج CV وقفزات دورية فوق 0.7 م للنموذج المدرب مسبقاً.
ضمانات السلامة: أظهرت محاكاة مونت كارلو أن ضبط معامل السلامة nσ يسمح بالموازنة بين العدوانية والسلامة. مع nσ=3، حققت الطريقة نسبة نجاح 100% في تجنب الاصطدامات عبر 50 تجربة، بينما فشل النهج الحتمي (nσ=0) في 36% من التجارب.
الأداء في الوقت الفعلي: ظل متوسط وقت الحوسبة لكل خطوة تحكم أقل بكثير من زمن أخذ العينات البالغ 50 مللي ثانية حتى بالنسبة لآفاق تنبؤ تصل إلى T=40، مما يؤكد الجدوى في الوقت الفعلي.
التحقق في العالم الحقيقي: في الأجهزة الفعلية، نجح النظام في تنفيذ مناورات تجنب استباقية، حيث استقر الـ ADE حول 0.05 م، مما أكد قابلية نقل النتائج الافتراضية إلى ديناميكيات العالم الحقيقي.
الأهمية والادعاءات تزعم الورقة أن SOWL-MPC يمثل تقدماً كبيراً من خلال سد الفجوة بين السلامة التفاعلية والتخطيط التنبئي في البيئات التي تحتوي على وكلاء متكيفين وغير معروفين. من خلال نمذجة وتعلم السياسة لروبوت العالم صراحةً بدلاً من مجرد تعلم ديناميكياته، وباستخدام OVC للتحديثات عبر الإنترنت بكفاءة، يحقق إطار العمل ضمانات سلامة تتكيف مع السلوك المرصود لروبوت العالم. يؤكد المؤلفون أن هذا هو أول تطبيق لـ OVC لهذا المشكل الروبوتي المحدد، مما يتيح تعلم السياسات الكامنة بكفاءة البيانات والتي يمكن دمجها مباشرة في حلقات التحكم الواعية باليقين. يوضح العمل أن الملاحة الآمنة والاستباقية قابلة للتحقيق حتى عندما يكون منطق التحكم لروبوت العالم غير معروف تماماً ولا تتوفر سوى قياسات حالة مشوشة.